教語言模型通過比較想法預測研究成功
該研究探討如何讓語言模型在實驗前預測研究想法是否成功。通過構建基於PapersWithCode的11488個想法對數據集,微調小模型達到77.1%準確率,甚至超過GPT-5。使用強化學習框架RLVR進一步提高可解釋性,展示了小模型在科學發現中的潛力。
隨着語言模型在自動生成假設和實現方面加速科學研究,一個新的瓶頸出現:如何在海量AI生成的想法中高效評估和篩選,而無需進行詳盡的實驗。來自ACL 2026 Findings的一篇論文提出,讓語言模型學習預測研究想法的實證成功,即在任何實驗運行之前進行預測。
研究人員定義了“比較實證預測”任務:給定一個基準特定的研究目標和兩個候選想法,預測哪個想法能取得更好的基準性能。他們從PapersWithCode構建了一個包含11,488個想法對的數據集,這些想法對基於客觀結果。實驗發現,未經微調的8B參數模型準確率僅為30%,而監督微調(SFT)將性能大幅提升至77.1%,甚至超過了GPT-5的61.1%。
為了進一步提升可解釋性,研究團隊將評估視為推理任務,採用帶可驗證獎勵的強化學習(RLVR)訓練模型發現潛在推理路徑。RLVR在達到71.35%準確率的同時,還能生成可解釋的正當理由。廣泛的消融實驗和分佈外測試表明,模型對錶面啓發式具有魯棒性,並能遷移到跨領域時間分割測試集和獨立構建的測試集。
這項研究證明,計算高效的小型語言模型可以充當有效、客觀的驗證者,為自主科學發現提供可擴展的路徑。論文已被ACL 2026 Findings接收,相關代碼和數據已公開。