方法是否支援主張?面向同行評審的論文內驗證
隨著科學投稿量激增,大型語言模型(LLM)被用於輔助同行評審。現有自動化新穎性評估通常將論文聲稱的貢獻與已有文獻比較,但人類評審員常因方法證據不足而質疑新穎性。為此,本文提出論文內主張驗證框架,利用LLM從引言中提取新穎性主張、檢索相關方法證據,並基於從182篇ICLR 2025論文評審中歸納的標準評估方法對主張的支撐程度。實驗表明,該框架的評估與人類評審員關注點高度一致,尤其在新穎性問題上。
隨著科學論文數量的持續增長,利用大型語言模型(LLM)輔助同行評審日益受到關注。然而,現有的自動化新穎性評估方法通常只將論文聲稱的貢獻與已有文獻進行對比,隱含地假設這些貢獻在論文自身中得到了準確實現。但人類評審員經常質疑新穎性主張,並非因為類似想法已經存在,而是因為論文中呈現的方法證據不足以支援這些主張。這種聲稱的貢獻與方法實現之間的內部不匹配,在當前的LLM評審系統中很少被檢查。
為了填補這一空白,研究人員提出了論文內主張驗證框架(intra-paper claim verification),用於評估論文中闡述的新穎性主張是否被實現這些主張的方法所證實。該框架的工作流程分為三個步驟:首先使用LLM從論文的引言部分自動提取出明確或隱含的新穎性主張;然後,框架檢索與這些主張相關的方**法論證據,例如實驗設計、模型架構、資料集、評估指標等;最後,透過一個結構化的評估模組判斷所呈現的方法是否足以支援所陳述的貢獻。評估過程並非自由形式,而是由從182篇ICLR 2025論文的人類同行評審中歸納出的標準所指導。這些標準涵蓋了新穎性、方法論、清晰度、可重複性等多個維度,能夠捕捉評審員反覆關注的各個方面,並用於生成類似人類評審風格的評估意見。
在實驗部分,研究人員收集了ICLR 2025的一批論文,包括被接收和被拒絕的論文,構建了一個平衡的資料集。他們讓LLM基於框架生成評審意見,並與這些論文實際收到的人類評審意見進行對比。透過人工評估和自動化指標(如BERTScore)分析,結果顯示框架生成的評估與人類評審員關注點之間存在顯著對齊,特別是在新穎性相關問題上。此外,BERTScore能夠有效區分對應的人-LLM評審對與隨機匹配的控制組,表明框架生成的內容確實捕捉到了與人類觀察一致的關注點。
這項研究的貢獻在於將LLM在同行評審中的應用從單純的外部文獻對比擴充套件到了論文內部的一致性驗證。它揭示了當前自動評審系統的一個重要盲點:即使論文聲稱的貢獻在文獻中是新穎的,但如果內部方法證據不足,這些貢獻仍然可能不被接受。該框架為未來開發更全面、更可靠的自動化評審工具提供了新的方向,有望減輕評審員負擔並提高評審質量。