AI News HubLIVE
站内改写2 分钟阅读

通过目标感知源选择重新思考分子分布外泛化

研究人员提出了SCOPE-BENCH,一种新的基准测试,用于评估极端分布外条件下的分子性质预测,以及POMA框架,它利用强化学习选择最优源骨架进行域适应。结果表明,现有模型在新基准上的误差增加高达8倍,而POMA将误差降低了最多11.2%。

来源arXiv Machine Learning作者: Zhuohao Lin, Kun Li, Jiameng Chen, Jiajun Yu, Duanhua Cao, Yizhen Zheng, Wenbin Hu

在人工智能驱动的药物发现中,分子性质的鲁棒预测在极端分布外(OOD)场景下是一个关键瓶颈。当前基于骨架分割的协议(scaffold-splitting)无法阻止微观语义重叠,导致模型倾向于捷径学习并高估其真实外推能力。同时,传统域适应方法在极端结构变化下表现不佳,因为盲目对齐异质源库会引入拓扑噪声并引发负迁移。

为了应对这两大挑战,研究人员提出了SCOPE-BENCH(骨架簇分布外性能评估基准),这是一个基于显式物理化学描述符空间中的簇级划分的基准测试。与现有方法不同,SCOPE-BENCH通过聚类确保训练集和测试集在分子结构上具有显著差异,从而更真实地反映模型的泛化能力。该基准包含多个簇,每个簇代表一组具有相似物理化学性质的分子,训练集和测试集来自不同的簇,从而评估模型在未见过的化学空间上的表现。

此外,研究团队还开发了POMA(多源适应策略优化)框架,该框架将知识转移形式化为一个“检索-组合-适应”流水线。首先,从有标签的源骨架中识别出与未标签目标结构接近的代理目标;然后,利用强化学习策略从指数级大的候选池中自适应选择最优源子集;最后,在宏观拓扑和微观药效团两个尺度上进行双尺度域适应。POMA的核心创新在于通过强化学习动态选择最适合的源数据,而不是盲目使用所有可用数据,从而避免了负迁移。

实验评估显示,最先进的3D分子模型(如EGNN、SphereNet等)在SCOPE-BENCH上的预测误差飙升最高达8.0倍,平均达5.9倍,表明现有模型在面对全新的分子骨架时几乎失效。而POMA在多种骨干架构上实现了平均绝对误差降低最高11.2%,平均相对改进6.2%。具体来说,POMA在EGNN上取得了最佳改进,误差降低11.2%,在SphereNet上降低了8.7%,在DimeNet++上降低了6.0%。这些结果证明,通过目标感知的源选择,POMA能够有效缓解极端分布外条件下的负迁移问题,显著提升分子性质预测的鲁棒性。

该研究的代码已在匿名仓库公开,为分子性质预测领域提供了新的评估标准和改进方向。未来工作可以进一步探索POMA在其他分子预测任务(如毒性预测、溶解度预测)上的应用,以及扩展到更多类型的分子表示学习模型中。