2024年諾貝爾化學獎授予AlphaFold2,這標誌著人工智慧在生物學領域的作用獲得了重要認可。在蛋白質結構預測取得突破之後,下一步是什麼?PLAID(蛋白質潛擴散生成模型)應運而生,它是一種多模態生成模型,透過利用蛋白質摺疊模型(如ESMFold)的潛在空間來生成新的蛋白質。與許多現有模型不同,PLAID能夠同時生成蛋白質的一維序列和三維全原子結構座標,解決了多模態共生成這一難題。
從結構預測到實際藥物設計,現有擴散模型仍存在諸多侷限性。例如,全原子生成需要知道序列資訊才能放置側鏈原子,而許多模型僅生成主鏈原子。此外,針對人類使用的蛋白質生物製品需要進行人源化改造以避免免疫排斥,而藥物發現過程中還需考慮溶解度等複雜約束。PLAID透過提供組合功能與生物體提示的介面,實現了對蛋白質生成的精細控制,類似於影像生成中的文本提示。具體而言,PLAID能夠學習金屬蛋白中常見的四面體半胱氨酸-鐵配位模式,同時保持序列水平的高度多樣性。
PLAID的一個關鍵優勢是僅使用序列資料來訓練生成模型。序列資料庫規模比結構資料庫大2到4個數量級,且獲取成本更低。訓練時,模型學習蛋白質摺疊模型潛在空間上的擴散過程;推理時,利用凍結的摺疊模型權重解碼出序列和結構。這種方法類似於機器人領域中的視覺-語言-動作模型,後者利用網際網路規模資料訓練的視覺-語言模型提供的先驗知識來增強感知和理解能力。
然而,直接應用這種方法面臨一個挑戰:ESMFold等Transformer模型的潛在空間需要大量正則化,且維度極高,類似於高解析度影像合成。為此,團隊提出了CHEAP(壓縮沙漏嵌入適應蛋白質)方法,透過聯合嵌入壓縮模型來學習蛋白質序列和結構的緊湊表示。透過機制可解釋性分析,他們發現該潛在空間實際上高度可壓縮,從而成功構建了全原子蛋白質生成模型。
未來,該方法可推廣到任何存在豐富模態到稀缺模態預測器的多模態生成任務。例如,隨著AlphaFold3等模型能夠預測蛋白質與核酸、配體的複合物,PLAID的方法有望用於更復雜系統的多模態生成。研究人員還邀請合作者共同擴充套件該方法,並進行溼實驗驗證。相關論文和程式碼已在bioRxiv上釋出。