因果模型需要因果數據——Xaira的X-Cell模型用於藥物發現(Bo Wang與Ci Chu,首席發現官與首席AI科學家)
Xaira Therapeutics通過生成大規模因果數據集X-Atlas,開發了X-Cell模型,突破了傳統轉錄組模型的瓶頸,實現了對基因表達變化的準確預測,為AI驅動藥物發現開闢了新路徑。
Xaira Therapeutics正全力押注數據生成以推動模型構建。其首席發現官Ci Chu與首席AI科學家Bo Wang在播客中闡述了核心理念:因果模型需要因果數據。
傳統上,虛擬細胞模型如scGPT依賴於CELLxGENE數據庫(包含1.68億個細胞的基因表達譜),但這些數據僅反映相關性而非因果關係。當模型參數超過15億時,測試損失不再下降,暴露出信息瓶頸。Bo Wang指出:“訓練一個3.1B參數模型時,它完全偏離了縮放規律,説明信息量不足。”
為解決這一問題,Xaira團隊構建了X-Atlas數據集。通過並行CRISPR干擾實驗,他們系統地對每個基因進行單獨擾動(“撥動旋鈕”),觀測上下游效應。這一過程產生了約30倍於CELLxGENE的信息量,使模型能夠學習基因間的因果鏈條。基於此,X-Cell模型採用了擴散架構而非自迴歸方法,併成功將參數擴展至數十億,驗證了信息量是模型性能的關鍵。
X-Cell的亮點在於其泛化能力。在真實人類細胞實驗中,它擊敗了長期以來最佳線性基線,證明了因果數據賦予模型真正的預測能力。Bo透露,這類數據收集實驗的基礎設施投入約數千萬美元,算力和研發成本數百萬美元,更像強化學習的預算而非預訓練。
Ci Chu和Bo Wang最近分別晉升為首席發現官和首席AI科學家,凸顯了Xaira對數據優先戰略的重視。他們強調,雖然一階因果效應已足夠強大,但未來還需處理多基因協同作用等更高階問題。Bo分享道,學術界在創新速度上仍有優勢,但工業界的資源集中讓X-Cell得以實現規模化應用。
這場關於“信息為王”的賭注,正在重塑AI驅動的藥物研發範式。