因果模型需要因果数据——Xaira的X-Cell模型用于药物发现(Bo Wang与Ci Chu,首席发现官与首席AI科学家)
Xaira Therapeutics通过生成大规模因果数据集X-Atlas,开发了X-Cell模型,突破了传统转录组模型的瓶颈,实现了对基因表达变化的准确预测,为AI驱动药物发现开辟了新路径。
Xaira Therapeutics正全力押注数据生成以推动模型构建。其首席发现官Ci Chu与首席AI科学家Bo Wang在播客中阐述了核心理念:因果模型需要因果数据。
传统上,虚拟细胞模型如scGPT依赖于CELLxGENE数据库(包含1.68亿个细胞的基因表达谱),但这些数据仅反映相关性而非因果关系。当模型参数超过15亿时,测试损失不再下降,暴露出信息瓶颈。Bo Wang指出:“训练一个3.1B参数模型时,它完全偏离了缩放规律,说明信息量不足。”
为解决这一问题,Xaira团队构建了X-Atlas数据集。通过并行CRISPR干扰实验,他们系统地对每个基因进行单独扰动(“拨动旋钮”),观测上下游效应。这一过程产生了约30倍于CELLxGENE的信息量,使模型能够学习基因间的因果链条。基于此,X-Cell模型采用了扩散架构而非自回归方法,并成功将参数扩展至数十亿,验证了信息量是模型性能的关键。
X-Cell的亮点在于其泛化能力。在真实人类细胞实验中,它击败了长期以来最佳线性基线,证明了因果数据赋予模型真正的预测能力。Bo透露,这类数据收集实验的基础设施投入约数千万美元,算力和研发成本数百万美元,更像强化学习的预算而非预训练。
Ci Chu和Bo Wang最近分别晋升为首席发现官和首席AI科学家,凸显了Xaira对数据优先战略的重视。他们强调,虽然一阶因果效应已足够强大,但未来还需处理多基因协同作用等更高阶问题。Bo分享道,学术界在创新速度上仍有优势,但工业界的资源集中让X-Cell得以实现规模化应用。
这场关于“信息为王”的赌注,正在重塑AI驱动的药物研发范式。