本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

データ汚染はスコアを押し上げるが、LLMリーダーボードの順位はほとんど変えない

記事の要約

スタンフォード大学と澳門城市大学の研究チームは、ベンチマーク汚染が「絶対スコアの水増し」と「順位の並び替え」のどちらに効くかを分離して検証した。ARC、GSM8K、HellaSwag、MMLUを対象に、47の公開モデルと74の既知汚染モデルを分析。標準ランキングと言い換え対照ランキングの順位相関は0.997で、汚染はほぼ一様で、スコアは上がるが順位はほとんど変わらないと結論している。

ソースarXiv Computational Linguistics著者: Xingyao Xiao (Stanford University), Yihong Cheng (City University of Macau)
データ汚染はスコアを押し上げるが、LLMリーダーボードの順位はほとんど変えない
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

スタンフォード大学のXingyao Xiao氏と澳門城市大学のYihong Cheng氏によるarXivプレプリントは、ベンチマーク汚染が大規模言語モデル(LLM)のリーダーボードに与える影響を再検討している。ベンチマーク汚染とは、テスト問題が学習データに漏れ込む現象であり、LLMリーダーボードの信頼性に対する脅威として広く語られている。著者らは、その議論が「汚染が絶対スコアを押し上げるか」と「汚染がモデルの順位を並べ替えるか」という異なる問いを混同していると指摘する。

両者の効果を分離するため、論文では汚染を「アンカー項目不変性」の違反と捉え直す。測定には、元の問題と意味的に等価な言い換え問題に対する応答差を用いる。この項目内対比は、測ろうとしている技能を同じに保ちながら、学習データ中の問題を覚えている効果と真の能力を分離できる。

実験はARC、GSM8K、HellaSwag、MMLUの4ベンチマークで実施された。47の公開モデルのインスタンスごとの応答と、既知の汚染量でファインチューニングした74モデルを使い、まず指標を検証した。測定値は注入した汚染量に応じて増加し、テストセット漏えいによる補正効果は+0.187精度ポイントだった。合法的な訓練分割のみで学習した陰性対照モデルは-0.012で、正常な学習を誤って汚染と判定しないことも確認された。

次にリーダーボードへの影響を定量化した。標準ランキングと言い換え対照ランキングの順位相関は0.997。感度分析では、観測された差別的汚染は順位を動かす水準を大きく下回っており、2つの参照条件で裏付けられた差別的汚染は188組中3組だけだった。差別的汚染とは、特定のモデルだけが他より多く評価データに触れている状態を指す。

これらの結果から、公開モデルでの汚染はほぼ一様であると結論できる。つまり絶対スコアは押し上げるが、リーダーボード上の相対順位はほとんど変えない。順位の歪みが生じるのはまれな差別的汚染が起きた場合に限られる。著者らは校正済みの不変性監査を参照実装として公開し、リーダーボード側も標準の順位とともに、信頼区間付きの言い換え対照ランキングを提示するよう提案している。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 汚染の影響は「絶対スコアの水増し」と「順位の並び替え」という2つの問題に分けて考えるべきである。
  • 元問題と意味的に等価な言い換え問題の応答差を指標化し、記憶と能力を分離。汚染注入量に応じて指標が上昇し、陰性対照は検出されなかった。
  • 47の公開モデルと74の既知汚染モデルを4ベンチマークで調べた結果、188モデル×基準組のうち3組でのみ差別的汚染が確認された。
  • 標準リーダーボードと言い換え対照リーダーボードの順位相関は0.997。汚染は絶対スコアを押し上げるが順位にはほとんど影響しない。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。