arXiv は 2026 年 9 月 2 日(水)20:35:02 UTC、新規プレプリント arXiv:2609.25046v1 を公開した。タイトルは「Peerify: Benchmarking Peer-Review Claim Verification」。著者は Alireza Daghighfarsoodeh 氏を筆頭に全 7 名(筆頭著者と 6 名の共著者)。分野は計算言語学(cs.CL)およびデジタル図書館(cs.DL)に分類されている。ファイルサイズは 107 KB、DOI は https://doi.org/10.48550/arXiv.2609.25046 で、PDF 全文、実験的な HTML 版、TeX ソースが利用可能。ブラウズ文脈は cs.CL の新着(2026 年 9 月)で、cs.DL への切り替えも可能。背景:査読は学術出版の中心的役割を担うが、査読者の指摘が原稿の証拠によって実際に裏付けられているかを確認する作業は、今なお大半が手作業で、時間と労力を要する。手法:著者らは Peerify を提案する。これは原稿の証拠に基づいて査読コメントの主張を検証するパイプラインである。原稿と査読コメントが与えられると、(1) 査読文を原子的な主張(atomic claims)に分解し、(2) 原稿から関連する証拠を検索し、(3) 各主張が論文によって支持されるかどうかを判定する、という流れで動作する。ベンチマーク:開発と評価のために、NeurIPS 2024 と ICLR 2024 から収集した実際の査読インタラクションに由来する 800 件の主張からなるベンチマークを構築した。さらに、自動生成された監督信号を監査するための、人手でラベル付けした 300 件のサブセットも含まれる。この「自動ラベル+人手監査」という二層設計は、本研究の注目すべき点のひとつである。実験:Peerify パイプライン内で最先端の言語モデルと検索戦略を評価し、含意(entailment)ベースラインとも比較した。結果は、検索中心の検証と主張の分解が重要であることを示す一方、曖昧で解釈を要する査読者の主張が依然として大きな課題であることを浮き彫りにした。自動ラベルは監査対象の主張の 90.3% で人手によるコンセンサスと一致し(Cohen の κ = 0.87)、一方で既製の含意モデルはマクロ F1 で 0.24 を下回ったままである。注意点:本論文は現時点で v1 のみであり、実験結果やベンチマーク構築の詳細は今後の査読と追試を経て検証される必要がある。またベンチマークは NeurIPS 2024 と ICLR 2024 の 2 会議に限定されているため、他の会議や分野、非英語の査読に一般化できるかは今後の課題である。加えて、arXiv のページには arXivLabs による実験的プロジェクト群や、NASA ADS、Google Scholar、Semantic Scholar といった引用・書誌ツールへのリンク、Connected Papers、Litmaps、scite、alphaXiv、Hugging Face、DagsHub などコード・データ関連リソースへの導線も掲載されている。ライセンス情報と TeX ソースも公開されており、再現や追試に向けた入口が用意されている。
Peerify:査読コメントの主張検証をベンチマーク化
記事の要約
研究者らは、査読コメントが原稿の証拠に支持されているかを検証するパイプライン Peerify を提案し、NeurIPS 2024 と ICLR 2024 の査読から得た 800 件の主張からなるベンチマークを構築した。自動ラベルは監査対象の 90.3% で人間の合意と一致し、既製の含意モデルはマクロ F1 0.24 未満だった。
ソースarXiv Computational Linguistics著者: Alireza Daghighfarsoodeh, Sajad Ebrahimi, Ali Ghorbanpour, Soroush Sadeghian, Radin Cheraghi, Negar Arabzadeh, Ebrahim Bagheri
Peerify:査読コメントの主張検証をベンチマーク化