AI News HubLIVE
站内改写2 分钟阅读

评估审稿指南设计对基于LLM的自动同行评审的影响

本研究分析了不同类型审稿指南(如官方会议指南和基于高质量人类评审生成的模仿性指南)对自动同行评审的影响。实验表明,官方会议指南产生的评审结果与人类判断最为一致,而严格的评分规则会降低性能。

来源arXiv Computational Linguistics作者: Haowen Li, Yoichi Ishibashi, Masafumi Oyamada

同行评审是科学研究中确保质量的关键环节,但近年来审稿工作量激增,使得自动化评审成为研究热点。一篇发表于ACL 2026 Findings的论文系统评估了审稿指南设计对基于大型语言模型(LLM)的自动同行评审系统的影响。研究团队来自多所机构,论文作者包括Haowen Li等人,于2026年5月16日提交至arXiv。该研究旨在探索如何设计有效的审稿指南,以提升自动化评审的质量和可靠性。

研究团队设计了两种类型的审稿指南:一是直接采用官方会议(如ACL)的审稿指南,这些指南经过多年会议实践检验,包含了明确的评估标准和评分细则;二是利用LLM从高质量人类评审中自动生成的“模仿审稿人”指南,即通过分析优秀审稿人的评分和评论,让LLM学习并生成类似的审稿标准。通过对比实验,他们发现使用官方指南生成的评审结果与人类评审员的一致性最高,表明经过会议实践验证的评估准则同样适用于自动化场景。而模仿审稿人的指南效果普遍较差,可能因为其难以完全捕捉人类评审的复杂性和主观性,或者因为高质量人类评审本身存在多样性和不一致性。

进一步分析显示,强制采用严格的评分标准(如rubric式分项打分)反而持续降低了评审质量。这一发现挑战了当前许多自动评审系统依赖标准化评分的做法,强调保留主观和整体性评分的重要性。研究指出,过于结构化的评分会限制LLM的表达能力,导致评分偏离人类判断,尤其是在需要权衡多方面因素时。相反,允许评审者进行整体性主观评分能更好地反映论文的真实质量。

该研究为设计更有效的自动同行评审系统提供了实证依据,特别是在指南制定和评分策略方面。未来工作可进一步探索如何结合官方指南的严谨性与人类评审的灵活性,例如动态调整指南的详细程度,或融合多种指南的优势。此外,研究还提示,自动化评审中应避免过度依赖结构化评分,而应重视人类评审的经验性判断。这项研究不仅对学术评审自动化有指导意义,也为LLM在更广泛的评估任务中的应用提供了参考。