AI News HubLIVE
サイト内リライト2 分で読了

AgentAtlas:LLMエージェントの結果リーダーボードを超えて

本稿では、AgentAtlasフレームワークを紹介する。これは、LLMエージェントを評価するための4つの要素から成る。6つの状態制御決定分類法、9カテゴリの軌道失敗分類法、分類法認識対盲目的手法、およびベンチマークカバレッジ監査である。実験では、明示的なラベルメニューを削除すると、すべてのモデルの軌道精度が14~40ポイント低下し、0.54~0.62の狭い範囲に収まり、どのモデルもすべての指標で勝利しなかった。

ソースarXiv AI著者: Parsa Mazaheri, Kasra Mazaheri

近年、大規模言語モデル(LLM)エージェントは、コードベース、ブラウザ、オペレーティングシステム、カレンダー、ファイル、ツールエコシステムなどで広く利用されるようになった。しかし、これらのエージェントを評価するためのベンチマークは断片的で統一されていない。各ベンチマークは、最終タスク成功率、ツール呼び出しの有効性、繰り返し実行の一貫性、軌道の安全性、または攻撃に対するロバスト性など、異なる測定単位に重点を置いている。2024年から2025年にかけての一連の研究は、単一の精度指標だけではデプロイ可能なエージェントを比較する適切な単位ではないという診断に収束した。そこで、AgentAtlasフレームワークが登場し、従来の結果リーダーボードを超えることを目指す。

AgentAtlasは4つの構成要素からなる。第一に、6状態の制御決定分類法を提案する。これは、エージェントの決定を行動(Act)、質問(Ask)、拒否(Refuse)、停止(Stop)、確認(Confirm)、回復(Recover)の6つに分類する。この分類法は、異なる状況下でのエージェントの行動パターンを体系的に記述するのに役立つ。

第二に、AgentAtlasは9カテゴリの軌道失敗分類法を導入し、それに直交する2つの階層ラベル(主要エラー源と影響)を付与する。これにより、研究者は失敗の根本原因とその結果を詳細に分析できるようになる。

第三に、AgentAtlasは分類法認識(taxonomy-aware)と分類法盲目的(taxonomy-blind)の比較手法を設計する。これら2つのプロンプトモードでのエージェントのパフォーマンスを比較することで、モデルの能力のどの程度がプロンプト内の明示的な監視に由来するかを定量化できる。実験では、明示的なラベルメニューを削除すると、すべてのモデルの軌道精度が14~40パーセントポイント低下し、モデルファミリーに関係なく0.54~0.62の狭い範囲に収束した。この発見は、現在の評価方法がモデルの内在的な能力を過大評価している可能性があることを示している。

最後に、AgentAtlasはベンチマークカバレッジ監査を実施し、15のエージェントベンチマークを6つの行動軸にマッピングすることで、既存のベンチマークのカバレッジの盲点を明らかにした。

実験では、研究者は8つのモデル(4つの最先端クローズドソースモデルと4つのオープンウェイトモデル)を使用し、2つのプロンプトモードで1342のテスト項目を生成した。結果は、制御精度、軌道診断、ツールコンテキストユーティリティ保持の3つの側面すべてで最良のスコアを達成したモデルは1つもなかったことを示している。これは、現在のエージェント能力評価には、単一のリーダーボードではなく、より包括的なフレームワークが必要であることを示唆している。

AgentAtlasの価値は、体系的な評価プロトコルを提供することにある。論文の著者は、この研究は測定プロトコルのデモンストレーションであり、新しいベンチマークのリリースではないと強調している。将来、このフレームワークは、エージェント評価をより細かく、より解釈可能な方向に推進する可能性がある。