AI News HubLIVE
站內改寫2 分鐘閱讀

通過目標感知源選擇重新思考分子分佈外泛化

研究人員提出了SCOPE-BENCH,一種新的基準測試,用於評估極端分佈外條件下的分子性質預測,以及POMA框架,它利用強化學習選擇最優源骨架進行域適應。結果表明,現有模型在新基準上的誤差增加高達8倍,而POMA將誤差降低了最多11.2%。

來源arXiv Machine Learning作者: Zhuohao Lin, Kun Li, Jiameng Chen, Jiajun Yu, Duanhua Cao, Yizhen Zheng, Wenbin Hu

在人工智能驅動的藥物發現中,分子性質的魯棒預測在極端分佈外(OOD)場景下是一個關鍵瓶頸。當前基於骨架分割的協議(scaffold-splitting)無法阻止微觀語義重疊,導致模型傾向於捷徑學習並高估其真實外推能力。同時,傳統域適應方法在極端結構變化下表現不佳,因為盲目對齊異質源庫會引入拓撲噪聲並引發負遷移。

為了應對這兩大挑戰,研究人員提出了SCOPE-BENCH(骨架簇分佈外性能評估基準),這是一個基於顯式物理化學描述符空間中的簇級劃分的基準測試。與現有方法不同,SCOPE-BENCH通過聚類確保訓練集和測試集在分子結構上具有顯著差異,從而更真實地反映模型的泛化能力。該基準包含多個簇,每個簇代表一組具有相似物理化學性質的分子,訓練集和測試集來自不同的簇,從而評估模型在未見過的化學空間上的表現。

此外,研究團隊還開發了POMA(多源適應策略優化)框架,該框架將知識轉移形式化為一個“檢索-組合-適應”流水線。首先,從有標籤的源骨架中識別出與未標籤目標結構接近的代理目標;然後,利用強化學習策略從指數級大的候選池中自適應選擇最優源子集;最後,在宏觀拓撲和微觀藥效團兩個尺度上進行雙尺度域適應。POMA的核心創新在於通過強化學習動態選擇最適合的源數據,而不是盲目使用所有可用數據,從而避免了負遷移。

實驗評估顯示,最先進的3D分子模型(如EGNN、SphereNet等)在SCOPE-BENCH上的預測誤差飆升最高達8.0倍,平均達5.9倍,表明現有模型在面對全新的分子骨架時幾乎失效。而POMA在多種骨幹架構上實現了平均絕對誤差降低最高11.2%,平均相對改進6.2%。具體來説,POMA在EGNN上取得了最佳改進,誤差降低11.2%,在SphereNet上降低了8.7%,在DimeNet++上降低了6.0%。這些結果證明,通過目標感知的源選擇,POMA能夠有效緩解極端分佈外條件下的負遷移問題,顯著提升分子性質預測的魯棒性。

該研究的代碼已在匿名倉庫公開,為分子性質預測領域提供了新的評估標準和改進方向。未來工作可以進一步探索POMA在其他分子預測任務(如毒性預測、溶解度預測)上的應用,以及擴展到更多類型的分子表示學習模型中。