跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

Peerify:面向同行评审论断验证的基准测试

文章摘要

研究者提出 Peerify 流水线,用于验证同行评审意见是否得到稿件证据支持,并构建了来自 NeurIPS 2024 和 ICLR 2024 的 800 条论断基准。自动标注在受审计论断上与人工共识一致率达 90.3%,而现成蕴含模型宏平均 F1 低于 0.24。

来源arXiv Computational Linguistics作者: Alireza Daghighfarsoodeh, Sajad Ebrahimi, Ali Ghorbanpour, Soroush Sadeghian, Radin Cheraghi, Negar Arabzadeh, Ebrahim Bagheri
Peerify:面向同行评审论断验证的基准测试
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

arXiv 于 2026 年 9 月 2 日(周三)20:35:02 UTC 发布了一篇新的预印本论文,编号 arXiv:2609.25046v1,标题为《Peerify: Benchmarking Peer-Review Claim Verification》(Peerify:面向同行评审断言验证的基准)。该论文由 Alireza Daghighfarsoodeh 领衔,共 7 位作者(第一作者加上 6 位合著者),归类于计算与语言(cs.CL)以及数字图书馆(cs.DL)两个学科分类。论文以 107 KB 的篇幅提交,DOI 为 https://doi.org/10.48550/arXiv.2609.25046,全文可通过 PDF、实验性 HTML 页面以及 TeX 源码获取,当前浏览语境为 cs.CL 的 2026 年 9 月新到论文,也可切换到 cs.DL 分类浏览。研究动机:同行评审在学术出版中处于核心地位,然而核查审稿人的意见是否真正得到稿件证据支撑,目前仍主要依靠人工完成,既耗时又费力,随着投稿量持续攀升,这种人工核查模式愈发难以规模化。方法:作者提出 Peerify,一个面向同行评审断言的、以稿件证据为锚的验证流水线。给定一份稿件和一条评审意见,Peerify 的工作流程分为三步:首先把评审意见分解为原子化断言(atomic claims),然后检索稿件中与之相关的证据片段,最后判断每一条断言是否被论文内容所支持。基准数据集:为支持流水线的开发与评测,作者构建了一个包含 800 条断言的基准,这些断言取自 NeurIPS 2024 与 ICLR 2024 中真实发生的同行评审交互;其中还包含一个由人工标注的 300 条断言子集,用于审计自动生成的监督信号是否可靠,这种自动标注加人工审计的双层设计是该项工作值得注意的细节之一。实验与结论:作者在 Peerify 流水线中评估了当前最先进的语言模型与多种检索策略,并设置蕴含(entailment)基线作为对照。结果表明,以检索为中心的验证方式与断言分解步骤都至关重要;与此同时,含糊其辞和带有解释性的审稿意见仍然构成显著挑战。在可量化的指标上,自动标注与人类共识在受审计断言上的吻合率达到 90.3%(Cohen 的 κ = 0.87),而现成的蕴含模型在宏平均 F1 上始终低于 0.24,两者的差距凸显了通用蕴含模型难以直接胜任这一任务。需要指出的是,该论文目前仅为 v1 版本,实验结论与基准构建细节仍有待同行评议与后续复现;此外,基准来源限于 NeurIPS 2024 与 ICLR 2024 两个会议,其结论能否推广到其他会议、其他学科领域或非英语评审场景,尚需进一步验证。论文页面还提供 arXivLabs 等社区实验项目入口,以及 NASA ADS、Google Scholar、Semantic Scholar、Connected Papers、Litmaps、scite、alphaXiv、Hugging Face、DagsHub 等书目、引文与代码数据关联工具的链接。

展开要点与分析

文章情报

投资人进阶

要点

  • Peerify 将评审意见拆解为原子化论断,检索稿件证据,并判断每个论断是否得到论文支持。
  • 基准包含 800 条来自 NeurIPS 2024 和 ICLR 2024 真实评审互动的论断,其中 300 条经人工标注用于审计自动监督。
  • 以检索为中心的验证和论断拆解至关重要;模糊且需要解释的审稿意见仍是难点。
  • 自动标注在受审计论断上与人工共识一致率为 90.3%(κ = 0.87),现成蕴含模型宏平均 F1 低于 0.24。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。