AI News HubLIVE
站內改寫1 分鐘閱讀

因果模型需要因果資料——Xaira的X-Cell模型用於藥物發現(Bo Wang與Ci Chu,首席發現官與首席AI科學家)

Xaira Therapeutics透過生成大規模因果資料集X-Atlas,開發了X-Cell模型,突破了傳統轉錄組模型的瓶頸,實現了對基因表達變化的準確預測,為AI驅動藥物發現開闢了新路徑。

來源Latent Space作者: RJ Honicky

Xaira Therapeutics正全力押注資料生成以推動模型構建。其首席發現官Ci Chu與首席AI科學家Bo Wang在播客中闡述了核心理念:因果模型需要因果資料。

傳統上,虛擬細胞模型如scGPT依賴於CELLxGENE資料庫(包含1.68億個細胞的基因表達譜),但這些資料僅反映相關性而非因果關係。當模型引數超過15億時,測試損失不再下降,暴露出資訊瓶頸。Bo Wang指出:“訓練一個3.1B引數模型時,它完全偏離了縮放規律,說明資訊量不足。”

為解決這一問題,Xaira團隊構建了X-Atlas資料集。透過並行CRISPR干擾實驗,他們系統地對每個基因進行單獨擾動(“撥動旋鈕”),觀測上下游效應。這一過程產生了約30倍於CELLxGENE的資訊量,使模型能夠學習基因間的因果鏈條。基於此,X-Cell模型採用了擴散架構而非自迴歸方法,併成功將引數擴充套件至數十億,驗證了資訊量是模型效能的關鍵。

X-Cell的亮點在於其泛化能力。在真實人類細胞實驗中,它擊敗了長期以來最佳線性基線,證明了因果資料賦予模型真正的預測能力。Bo透露,這類資料收集實驗的基礎設施投入約數千萬美元,算力和研發成本數百萬美元,更像強化學習的預算而非預訓練。

Ci Chu和Bo Wang最近分別晉升為首席發現官和首席AI科學家,凸顯了Xaira對資料優先戰略的重視。他們強調,雖然一階因果效應已足夠強大,但未來還需處理多基因協同作用等更高階問題。Bo分享道,學術界在創新速度上仍有優勢,但工業界的資源集中讓X-Cell得以實現規模化應用。

這場關於“資訊為王”的賭注,正在重塑AI驅動的藥物研發正規化。