DataPrep-Bench:LLMを訓練データ準備者として評価するベンチマーク
DataPrep-Benchは、大規模言語モデル(LLM)のデータ構築とデータ品質評価の2つの補完的能力を、6つのドメインと複数のベースモデルにわたって統合的に評価する初の統一ベンチマークです。Data-Construction-SkillエージェントとDistributional Alignment Score(DAS)を導入し、複数のドメインで最先端の結果を達成しました。
訓練データの品質は大規模言語モデル(LLM)の能力を根本的に決定づけますが、LLM、エージェント、データ中心のワークフローが実際に訓練データをエンドツーエンドでどれだけうまく準備できるかを測定する統一されたベンチマークはこれまで存在しませんでした。このギャップを埋めるため、Hao LiangらはDataPrep-Benchを提案しました。これは、LLM駆動のデータ準備における2つの補完的な能力、すなわちデータ構築(生のソースを教師あり訓練データに変換する)とデータ品質評価(下流訓練前に候補データセットの訓練価値を予測する)を、共有の下流訓練プロトコルの下で統合的に評価する初の統一ベンチマークです。ここで「品質」とは、表面的なテキスト特性ではなく、下流訓練での実用性を指します。
DataPrep-Benchは、金融、数学、科学、医学など6つのドメインをカバーし、複数のベースモデルを使用します。データ構築では、すべての手法が同一の生データソースを消費し、その出力をDolly-15kと併せてベースモデルを微調整することでスコアリングされます。研究者らはまた、スキル誘導エージェントであるData-Construction-Skillを公開しました。これは、Llama-3.1-8Bモデルの金融ドメインにおいて、Dollyのみのベースラインを約20絶対ポイント引き上げ、知識抽出が密集するドメイン(例:医学)では最も強力なエージェントベースおよびDataFlowベースの手法と同等の性能を発揮します。
データ品質評価では、スコアリング関数は共有候補プールにおける下流性能とのピアソン相関で評価されます。研究者らは分布アライメントスコア(DAS)を提案しました。これは、候補データセットとドメインプロキシ間の最大平均不一致(MMD)を使用する分布ベースの評価器です。DASは6つのドメイン中4つで最も強いモデル間相関を達成し、数学、科学、医学の3つのドメインで同時にr > 0.70を超える唯一の指標であり、既存の品質ベース、多様性ベース、ヒューリスティックベースの評価器を凌駕します。
DataPrep-Benchは、LLM駆動のデータ準備における両方の能力を同等の目標として進捗を測定するための、統一された下流訓練に基づくフレームワークを提供します。このベンチマークにより、データ中心AIの研究が加速され、より効率的で高品質な訓練データ準備手法の開発が促進され、LLMの能力向上に貢献することが期待されます。関連するコードとモデルは公開されています。