DecisionBench: 長期的なエージェントワークフローにおける創発的委任のベンチマーク
DecisionBenchは、長期的なエージェントワークフローにおける創発的委任を評価するためのベンチマーク基盤です。タスクスイート(GAIA、tau-bench、BFCL multi-turn)、モデルプール(11モデル、7ベンダーファミリー)、委任インターフェース(call_modelとオプションのread_profileチャネル)、決定論的スキル注釈レイヤー、および品質、コスト、レイテンシ、委任率、ルーティング忠実度(top-k)、ベンダー自己選好、反事実的委任上限を含む多次元メトリクススイートを固定化しています。この基盤は、ピア情報の生成や配信方法に依存しないため、学習型ルーター、リッチなピアメモリ、適応的プロファイル構築、マルチステップ委任などを評価できます。研究チームはフルモデルプールを用いて5条件のリファレンススイープ(n=23,375)を実施し、以下の3つの主要な知見を得ました:(i) 4つの認識条件間で平均エンドタスク品質に統計的有意差はなく(|β| = 0.21)、品質のみの評価ではオーケストレーションシグナルを見逃すこと、(ii) ルーティング忠実度(top-1)は条件間で7.5%から29.5%の範囲で変動し、配信チャネル(オンデマンドツール vs プリロード説明)が説明内容よりも支配的であること、(iii) 反事実的上限により、完全な委任は各スイートで測定性能より15~31パーセントポイント高い位置にあり、将来のオーケストレーション手法に大きな未達成余地があること。研究チームは基盤、注釈レイヤー、リファレンス介入スイート、分析パイプライン、および220の条件別実行アーカイブを公開しています。
近年、長期的なエージェントワークフローにおける創発的委任を評価するためのベンチマーク「DecisionBench」が提案されました。本研究はYuxuan Gaoら5名の著者により行われ、arXiv(番号:2605.19099)に提出されています。
DecisionBenchは、タスクスイート(GAIA、tau-bench、BFCL multi-turn)、モデルプール(11モデル、7ベンダーファミリー:OpenAI、Google、Anthropic、Meta、Mistral、Cohere、xAIなど)、委任インターフェース(call_modelとオプションのread_profileチャネル)、決定論的スキル注釈レイヤー、および品質、コスト、レイテンシ、委任率、ルーティング忠実度(top-k)、ベンダー自己選好、反事実的委任上限を含む多次元メトリクススイートを固定化した標準化基盤です。この基盤は、ピア情報の生成や配信方法に依存しないため、学習型ルーター、リッチなピアメモリ、適応的プロファイル構築、マルチステップ委任など、様々な手法を評価できます。
研究チームは、フルモデルプールを用いて5条件のリファレンススイープを実施しました。条件は「認識なし」(モデルはタスクのみ受信)、「自己説明のみ」、「パフォーマンスデータのみ」、「完全情報」(自己説明とパフォーマンスデータ)の4つに加え、追加の制御条件を含む計5条件で、合計23,375のタスクインスタンスを分析しました。その結果、以下の3つの主要な知見が得られました。(i)4つの認識条件間で平均エンドタスク品質に統計的有意差はなく(|β| = 0.21)、品質のみの評価ではオーケストレーションシグナルを見逃すこと。(ii)平均品質がほぼ等しい条件下で、ルーティング忠実度(top-1)は7.5%から29.5%の範囲で変動し、配信チャネル(オンデマンドツール vs プリロード説明)が説明内容よりも支配的であること。特に、オンデマンドツールを使用してエージェント情報を配信する場合、プリロード説明よりもルーティング精度が大幅に向上しました。(iii)反事実的上限により、完全な委任は各スイートで測定性能より15~31パーセントポイント高い位置にあり、将来のオーケストレーション手法に大きな未達成余地があること。例えば、GAIAスイートでは現在の最良のルーティング手法で約60%の精度であるのに対し、完全な委任では理論上85%以上に達する可能性があります。
研究チームは、基盤、注釈レイヤー、リファレンス介入スイート、分析パイプライン、および220の条件別実行アーカイブを公開しています。これらのリソースはGitHubでホストされており、研究者が実験を再現し、新しい委任・オーケストレーション戦略を探索するために利用できます。DecisionBenchの提案は、マルチエージェントシステム研究に標準化された再現可能な評価フレームワークを提供し、当該分野の急速な発展を促進することが期待されます。