跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

重新利用蛋白質摺疊模型進行潛擴散生成

文章摘要

PLAID是一種多模態生成模型,通過學習蛋白質摺疊模型的潛空間,同時生成蛋白質的一維序列和三維結構。它僅需序列數據訓練,並支持功能與生物體提示,解決了全原子生成、生物體特異性和控制規範等實際問題。

來源BAIR Blog
重新利用蛋白質摺疊模型進行潛擴散生成
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

2024年諾貝爾化學獎授予AlphaFold2,這標誌着人工智能在生物學領域的作用獲得了重要認可。在蛋白質結構預測取得突破之後,下一步是什麼?PLAID(蛋白質潛擴散生成模型)應運而生,它是一種多模態生成模型,通過利用蛋白質摺疊模型(如ESMFold)的潛在空間來生成新的蛋白質。與許多現有模型不同,PLAID能夠同時生成蛋白質的一維序列和三維全原子結構座標,解決了多模態共生成這一難題。

從結構預測到實際藥物設計,現有擴散模型仍存在諸多侷限性。例如,全原子生成需要知道序列信息才能放置側鏈原子,而許多模型僅生成主鏈原子。此外,針對人類使用的蛋白質生物製品需要進行人源化改造以避免免疫排斥,而藥物發現過程中還需考慮溶解度等複雜約束。PLAID通過提供組合功能與生物體提示的界面,實現了對蛋白質生成的精細控制,類似於圖像生成中的文本提示。具體而言,PLAID能夠學習金屬蛋白中常見的四面體半胱氨酸-鐵配位模式,同時保持序列水平的高度多樣性。

PLAID的一個關鍵優勢是僅使用序列數據來訓練生成模型。序列數據庫規模比結構數據庫大2到4個數量級,且獲取成本更低。訓練時,模型學習蛋白質摺疊模型潛在空間上的擴散過程;推理時,利用凍結的摺疊模型權重解碼出序列和結構。這種方法類似於機器人領域中的視覺-語言-動作模型,後者利用互聯網規模數據訓練的視覺-語言模型提供的先驗知識來增強感知和理解能力。

然而,直接應用這種方法面臨一個挑戰:ESMFold等Transformer模型的潛在空間需要大量正則化,且維度極高,類似於高分辨率圖像合成。為此,團隊提出了CHEAP(壓縮沙漏嵌入適應蛋白質)方法,通過聯合嵌入壓縮模型來學習蛋白質序列和結構的緊湊表示。通過機制可解釋性分析,他們發現該潛在空間實際上高度可壓縮,從而成功構建了全原子蛋白質生成模型。

未來,該方法可推廣到任何存在豐富模態到稀缺模態預測器的多模態生成任務。例如,隨着AlphaFold3等模型能夠預測蛋白質與核酸、配體的複合物,PLAID的方法有望用於更復雜系統的多模態生成。研究人員還邀請合作者共同擴展該方法,並進行濕實驗驗證。相關論文和代碼已在bioRxiv上發佈。

展開要點與分析

文章情報

工程師進階

要點

  • PLAID利用蛋白質摺疊模型的潛空間進行擴散生成,實現序列與結構的同時生成。
  • 僅需序列數據訓練,利用序列數據庫規模優勢(比結構數據庫大2-4個數量級)。
  • 提出CHEAP壓縮方法,解決Transformer潛空間正則化與高維問題。
  • 支持功能與生物體提示控制,向文本界面控制生成邁進。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。