AI News HubLIVE
サイト内リライト2 分で読了

Shapleyを超えて:LLMアライメントと評価のための影響ベースデータ監査パイプライン

反復的なモデル再学習なしにShapley値を近似するスケーラブルで推論のみのデータ評価パイプラインを提案。セマンティックk-NNグラフと対数尤度シフトを用いてデータ有用性を評価。HelpSteer2およびHH-RLHFデータセットに適用し、手動監査スペースを99.1%削減、数千の隠れた選好反転を発見し、人間のグラウンドトゥルースラベルの欠陥を明らかにする。

ソースarXiv Machine Learning著者: Yunting Song, Matthew Watson, Peter Grabowski, Jun Qin

大規模言語モデル(LLM)のアライメントは、データ品質によってますますボトルネックが生じています。データセットが大規模化するにつれて、膨大な選好および指示調整コーパスには、隠れた構造的矛盾、安全性リスク、体系的な人間のアノテーションエラーが避けられず蓄積されます。標準的なデータセット監査手法(セマンティック重複除去やLLM-as-a-judgeなど)は、個々のレコードの実際の予測影響を捉えるのに苦労し、深い機能ルールの衝突を見逃すことがよくあります。

この課題に対処するため、研究者らは、反復的なモデル再学習を必要とせずにShapley値を近似する、スケーラブルで推論のみのデータ評価パイプラインを導入しました。セマンティックk-NN近傍を有向グラフにマッピングすることにより、このフレームワークは参照LLMの確率分布を通じて、ゼロショットおよびワンショットの条件付き対数尤度シフトを使用してデータ有用性を直接評価します。その後、パイプラインはこれらの予測影響スコアを局所的なアドバンテージメトリクスに変換し、勾配競合レコードを分離します。

研究チームは、2つの厳重に精査されたアライメントデータセットでパイプラインの有効性を実証しました。まず、HelpSteer2データセットにパイプラインを適用したところ、手動監査の検索スペースが99.1%削減され、多様な障害モードにわたって誤ラベル付けされたレコードを発見することに成功しました。次に、AnthropicのHH-RLHFトレーニングおよび評価分割に自動監査戦略を適用したところ、数千の隠れた安全性および事実の選好反転が特定されました。さらに重要なことに、この監査を評価分割に拡張したところ、現在のベンチマークの完全性における深刻な脆弱性が明らかになりました:高性能モデルがより安全またはより役立つ応答を頻繁に予測するにもかかわらず、客観的に欠陥のある人間のグラウンドトゥルースラベルによって罰せられています。

全体として、この研究は、人間のラベル障害を発見し、評価ベンチマークを浄化し、LLMアライメントデータの完全性を確保するための、数学的に基づいた高効率な診断ツールを提供します。このアプローチは、データ監査の効率を向上させるだけでなく、AIアライメント研究に新たな視点をもたらし、より信頼性の高いAIシステムの構築に貢献します。