arXiv 於 2026 年 9 月 2 日(週三)20:35:02 UTC 釋出了一篇新的預印本論文,編號 arXiv:2609.25046v1,標題為《Peerify: Benchmarking Peer-Review Claim Verification》(Peerify:面向同行評審斷言驗證的基準)。該論文由 Alireza Daghighfarsoodeh 領銜,共 7 位作者(第一作者加上 6 位合著者),歸類於計算與語言(cs.CL)以及數字圖書館(cs.DL)兩個學科分類。論文以 107 KB 的篇幅提交,DOI 為 https://doi.org/10.48550/arXiv.2609.25046,全文可透過 PDF、實驗性 HTML 頁面以及 TeX 原始碼獲取,當前瀏覽語境為 cs.CL 的 2026 年 9 月新到論文,也可切換到 cs.DL 分類瀏覽。研究動機:同行評審在學術出版中處於核心地位,然而核查審稿人的意見是否真正得到稿件證據支撐,目前仍主要依靠人工完成,既耗時又費力,隨著投稿量持續攀升,這種人工核查模式愈發難以規模化。方法:作者提出 Peerify,一個面向同行評審斷言的、以稿件證據為錨的驗證流水線。給定一份稿件和一條評審意見,Peerify 的工作流程分為三步:首先把評審意見分解為原子化斷言(atomic claims),然後檢索稿件中與之相關的證據片段,最後判斷每一條斷言是否被論文內容所支援。基準資料集:為支援流水線的開發與評測,作者構建了一個包含 800 條斷言的基準,這些斷言取自 NeurIPS 2024 與 ICLR 2024 中真實發生的同行評審互動;其中還包含一個由人工標註的 300 條斷言子集,用於審計自動生成的監督訊號是否可靠,這種自動標註加人工審計的雙層設計是該項工作值得注意的細節之一。實驗與結論:作者在 Peerify 流水線中評估了當前最先進的語言模型與多種檢索策略,並設定蘊含(entailment)基線作為對照。結果表明,以檢索為中心的驗證方式與斷言分解步驟都至關重要;與此同時,含糊其辭和帶有解釋性的審稿意見仍然構成顯著挑戰。在可量化的指標上,自動標註與人類共識在受審計斷言上的吻合率達到 90.3%(Cohen 的 κ = 0.87),而現成的蘊含模型在宏平均 F1 上始終低於 0.24,兩者的差距凸顯了通用蘊含模型難以直接勝任這一任務。需要指出的是,該論文目前僅為 v1 版本,實驗結論與基準構建細節仍有待同行評議與後續復現;此外,基準來源限於 NeurIPS 2024 與 ICLR 2024 兩個會議,其結論能否推廣到其他會議、其他學科領域或非英語評審場景,尚需進一步驗證。論文頁面還提供 arXivLabs 等社群實驗專案入口,以及 NASA ADS、Google Scholar、Semantic Scholar、Connected Papers、Litmaps、scite、alphaXiv、Hugging Face、DagsHub 等書目、引文與程式碼資料關聯工具的連結。
Peerify:面向同行評審論斷驗證的基準測試
文章摘要
研究者提出 Peerify 流水線,用於驗證同行評審意見是否得到稿件證據支援,並構建了來自 NeurIPS 2024 和 ICLR 2024 的 800 條論斷基準。自動標註在受審計論斷上與人工共識一致率達 90.3%,而現成蘊含模型宏平均 F1 低於 0.24。
來源arXiv Computational Linguistics作者: Alireza Daghighfarsoodeh, Sajad Ebrahimi, Ali Ghorbanpour, Soroush Sadeghian, Radin Cheraghi, Negar Arabzadeh, Ebrahim Bagheri
Peerify:面向同行評審論斷驗證的基準測試