跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

Peerify:面向同行評審論斷驗證的基準測試

文章摘要

研究者提出 Peerify 流水線,用於驗證同行評審意見是否得到稿件證據支持,並構建了來自 NeurIPS 2024 和 ICLR 2024 的 800 條論斷基準。自動標註在受審計論斷上與人工共識一致率達 90.3%,而現成藴含模型宏平均 F1 低於 0.24。

來源arXiv Computational Linguistics作者: Alireza Daghighfarsoodeh, Sajad Ebrahimi, Ali Ghorbanpour, Soroush Sadeghian, Radin Cheraghi, Negar Arabzadeh, Ebrahim Bagheri
Peerify:面向同行評審論斷驗證的基準測試
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

arXiv 於 2026 年 9 月 2 日(週三)20:35:02 UTC 發佈了一篇新的預印本論文,編號 arXiv:2609.25046v1,標題為《Peerify: Benchmarking Peer-Review Claim Verification》(Peerify:面向同行評審斷言驗證的基準)。該論文由 Alireza Daghighfarsoodeh 領銜,共 7 位作者(第一作者加上 6 位合著者),歸類於計算與語言(cs.CL)以及數字圖書館(cs.DL)兩個學科分類。論文以 107 KB 的篇幅提交,DOI 為 https://doi.org/10.48550/arXiv.2609.25046,全文可通過 PDF、實驗性 HTML 頁面以及 TeX 源碼獲取,當前瀏覽語境為 cs.CL 的 2026 年 9 月新到論文,也可切換到 cs.DL 分類瀏覽。研究動機:同行評審在學術出版中處於核心地位,然而核查審稿人的意見是否真正得到稿件證據支撐,目前仍主要依靠人工完成,既耗時又費力,隨着投稿量持續攀升,這種人工核查模式愈發難以規模化。方法:作者提出 Peerify,一個面向同行評審斷言的、以稿件證據為錨的驗證流水線。給定一份稿件和一條評審意見,Peerify 的工作流程分為三步:首先把評審意見分解為原子化斷言(atomic claims),然後檢索稿件中與之相關的證據片段,最後判斷每一條斷言是否被論文內容所支持。基準數據集:為支持流水線的開發與評測,作者構建了一個包含 800 條斷言的基準,這些斷言取自 NeurIPS 2024 與 ICLR 2024 中真實發生的同行評審交互;其中還包含一個由人工標註的 300 條斷言子集,用於審計自動生成的監督信號是否可靠,這種自動標註加人工審計的雙層設計是該項工作值得注意的細節之一。實驗與結論:作者在 Peerify 流水線中評估了當前最先進的語言模型與多種檢索策略,並設置藴含(entailment)基線作為對照。結果表明,以檢索為中心的驗證方式與斷言分解步驟都至關重要;與此同時,含糊其辭和帶有解釋性的審稿意見仍然構成顯著挑戰。在可量化的指標上,自動標註與人類共識在受審計斷言上的吻合率達到 90.3%(Cohen 的 κ = 0.87),而現成的藴含模型在宏平均 F1 上始終低於 0.24,兩者的差距凸顯了通用藴含模型難以直接勝任這一任務。需要指出的是,該論文目前僅為 v1 版本,實驗結論與基準構建細節仍有待同行評議與後續復現;此外,基準來源限於 NeurIPS 2024 與 ICLR 2024 兩個會議,其結論能否推廣到其他會議、其他學科領域或非英語評審場景,尚需進一步驗證。論文頁面還提供 arXivLabs 等社區實驗項目入口,以及 NASA ADS、Google Scholar、Semantic Scholar、Connected Papers、Litmaps、scite、alphaXiv、Hugging Face、DagsHub 等書目、引文與代碼數據關聯工具的鏈接。

展開要點與分析

文章情報

投資人進階

要點

  • Peerify 將評審意見拆解為原子化論斷,檢索稿件證據,並判斷每個論斷是否得到論文支持。
  • 基準包含 800 條來自 NeurIPS 2024 和 ICLR 2024 真實評審互動的論斷,其中 300 條經人工標註用於審計自動監督。
  • 以檢索為中心的驗證和論斷拆解至關重要;模糊且需要解釋的審稿意見仍是難點。
  • 自動標註在受審計論斷上與人工共識一致率為 90.3%(κ = 0.87),現成藴含模型宏平均 F1 低於 0.24。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。