AI News HubLIVE
站內改寫2 分鐘閱讀

評估審稿指南設計對基於LLM的自動同行評審的影響

本研究分析了不同類型審稿指南(如官方會議指南和基於高質量人類評審生成的模仿性指南)對自動同行評審的影響。實驗表明,官方會議指南產生的評審結果與人類判斷最為一致,而嚴格的評分規則會降低性能。

來源arXiv Computational Linguistics作者: Haowen Li, Yoichi Ishibashi, Masafumi Oyamada

同行評審是科學研究中確保質量的關鍵環節,但近年來審稿工作量激增,使得自動化評審成為研究熱點。一篇發表於ACL 2026 Findings的論文系統評估了審稿指南設計對基於大型語言模型(LLM)的自動同行評審系統的影響。研究團隊來自多所機構,論文作者包括Haowen Li等人,於2026年5月16日提交至arXiv。該研究旨在探索如何設計有效的審稿指南,以提升自動化評審的質量和可靠性。

研究團隊設計了兩種類型的審稿指南:一是直接採用官方會議(如ACL)的審稿指南,這些指南經過多年會議實踐檢驗,包含了明確的評估標準和評分細則;二是利用LLM從高質量人類評審中自動生成的“模仿審稿人”指南,即通過分析優秀審稿人的評分和評論,讓LLM學習並生成類似的審稿標準。通過對比實驗,他們發現使用官方指南生成的評審結果與人類評審員的一致性最高,表明經過會議實踐驗證的評估準則同樣適用於自動化場景。而模仿審稿人的指南效果普遍較差,可能因為其難以完全捕捉人類評審的複雜性和主觀性,或者因為高質量人類評審本身存在多樣性和不一致性。

進一步分析顯示,強制採用嚴格的評分標準(如rubric式分項打分)反而持續降低了評審質量。這一發現挑戰了當前許多自動評審系統依賴標準化評分的做法,強調保留主觀和整體性評分的重要性。研究指出,過於結構化的評分會限制LLM的表達能力,導致評分偏離人類判斷,尤其是在需要權衡多方面因素時。相反,允許評審者進行整體性主觀評分能更好地反映論文的真實質量。

該研究為設計更有效的自動同行評審系統提供了實證依據,特別是在指南制定和評分策略方面。未來工作可進一步探索如何結合官方指南的嚴謹性與人類評審的靈活性,例如動態調整指南的詳細程度,或融合多種指南的優勢。此外,研究還提示,自動化評審中應避免過度依賴結構化評分,而應重視人類評審的經驗性判斷。這項研究不僅對學術評審自動化有指導意義,也為LLM在更廣泛的評估任務中的應用提供了參考。