AI News HubLIVE
站内改写1 分钟阅读

教语言模型通过比较想法预测研究成功

该研究探讨如何让语言模型在实验前预测研究想法是否成功。通过构建基于PapersWithCode的11488个想法对数据集,微调小模型达到77.1%准确率,甚至超过GPT-5。使用强化学习框架RLVR进一步提高可解释性,展示了小模型在科学发现中的潜力。

来源arXiv Machine Learning作者: Srujan P Mule, Aniketh Garikaparthi, Manasi Patwardhan

随着语言模型在自动生成假设和实现方面加速科学研究,一个新的瓶颈出现:如何在海量AI生成的想法中高效评估和筛选,而无需进行详尽的实验。来自ACL 2026 Findings的一篇论文提出,让语言模型学习预测研究想法的实证成功,即在任何实验运行之前进行预测。

研究人员定义了“比较实证预测”任务:给定一个基准特定的研究目标和两个候选想法,预测哪个想法能取得更好的基准性能。他们从PapersWithCode构建了一个包含11,488个想法对的数据集,这些想法对基于客观结果。实验发现,未经微调的8B参数模型准确率仅为30%,而监督微调(SFT)将性能大幅提升至77.1%,甚至超过了GPT-5的61.1%。

为了进一步提升可解释性,研究团队将评估视为推理任务,采用带可验证奖励的强化学习(RLVR)训练模型发现潜在推理路径。RLVR在达到71.35%准确率的同时,还能生成可解释的正当理由。广泛的消融实验和分布外测试表明,模型对表面启发式具有鲁棒性,并能迁移到跨领域时间分割测试集和独立构建的测试集。

这项研究证明,计算高效的小型语言模型可以充当有效、客观的验证者,为自主科学发现提供可扩展的路径。论文已被ACL 2026 Findings接收,相关代码和数据已公开。