方法是否支持主张?面向同行评审的论文内验证
随着科学投稿量激增,大型语言模型(LLM)被用于辅助同行评审。现有自动化新颖性评估通常将论文声称的贡献与已有文献比较,但人类评审员常因方法证据不足而质疑新颖性。为此,本文提出论文内主张验证框架,利用LLM从引言中提取新颖性主张、检索相关方法证据,并基于从182篇ICLR 2025论文评审中归纳的标准评估方法对主张的支撑程度。实验表明,该框架的评估与人类评审员关注点高度一致,尤其在新颖性问题上。
随着科学论文数量的持续增长,利用大型语言模型(LLM)辅助同行评审日益受到关注。然而,现有的自动化新颖性评估方法通常只将论文声称的贡献与已有文献进行对比,隐含地假设这些贡献在论文自身中得到了准确实现。但人类评审员经常质疑新颖性主张,并非因为类似想法已经存在,而是因为论文中呈现的方法证据不足以支持这些主张。这种声称的贡献与方法实现之间的内部不匹配,在当前的LLM评审系统中很少被检查。
为了填补这一空白,研究人员提出了论文内主张验证框架(intra-paper claim verification),用于评估论文中阐述的新颖性主张是否被实现这些主张的方法所证实。该框架的工作流程分为三个步骤:首先使用LLM从论文的引言部分自动提取出明确或隐含的新颖性主张;然后,框架检索与这些主张相关的方**法论证据,例如实验设计、模型架构、数据集、评估指标等;最后,通过一个结构化的评估模块判断所呈现的方法是否足以支持所陈述的贡献。评估过程并非自由形式,而是由从182篇ICLR 2025论文的人类同行评审中归纳出的标准所指导。这些标准涵盖了新颖性、方法论、清晰度、可重复性等多个维度,能够捕捉评审员反复关注的各个方面,并用于生成类似人类评审风格的评估意见。
在实验部分,研究人员收集了ICLR 2025的一批论文,包括被接收和被拒绝的论文,构建了一个平衡的数据集。他们让LLM基于框架生成评审意见,并与这些论文实际收到的人类评审意见进行对比。通过人工评估和自动化指标(如BERTScore)分析,结果显示框架生成的评估与人类评审员关注点之间存在显著对齐,特别是在新颖性相关问题上。此外,BERTScore能够有效区分对应的人-LLM评审对与随机匹配的控制组,表明框架生成的内容确实捕捉到了与人类观察一致的关注点。
这项研究的贡献在于将LLM在同行评审中的应用从单纯的外部文献对比扩展到了论文内部的一致性验证。它揭示了当前自动评审系统的一个重要盲点:即使论文声称的贡献在文献中是新颖的,但如果内部方法证据不足,这些贡献仍然可能不被接受。该框架为未来开发更全面、更可靠的自动化评审工具提供了新的方向,有望减轻评审员负担并提高评审质量。