InferenceBench:AIエージェントによるオープンエンドなLLM推論最適化のためのベンチマーク
InferenceBenchは、AIエージェントがオープンエンドなLLM推論最適化を行う能力を評価する新しいベンチマークです。エージェントは2時間以内にターゲットLLMの推論速度を最適化する必要があり、プリフィルレイテンシ、デコードレイテンシ、同時リクエストスループットの3つのボトルネックを個別に、また全てを同時に最適化する4つのシナリオが用意されています。実験の結果、エージェントはベースラインを最大8.08倍改善するものの、単純なハイパーパラメータ探索(11.53倍)には及ばず、また単一の推論フレームワークに収束する傾向が見られました。
AIエージェントは研究開発タスクの自動化にますます利用されていますが、既存のベンチマークは通常、所定のワークフローや狭いアクション空間で評価を行います。名目上オープンエンドなタスクであっても、よく知られたレシピを取得し、いくつかのハイパーパラメータを調整するだけで解決できることが多く、そのため強い結果が真の最適化を反映しているのか、それとも記憶された解決策なのかが不明瞭になっています。そこで、研究者らはInferenceBenchを導入しました。これは、エージェントがOpenAI互換の推論サーバをデプロイし、LLM推論の速度を最適化することを要求するベンチマークです。
各エージェントには、ターゲットLLM、1基のH100 GPU、最適化シナリオ、そして2時間の壁時計時間予算が与えられます。3つの最適化シナリオは推論の個別のボトルネック(プリフィルレイテンシ、デコードレイテンシ、同時リクエストスループット)を分離し、4つ目のシナリオはこれらすべてを同時にバランスさせます。15のフロンティアエージェント構成による実験の結果、エージェントは素のPyTorchベースラインを確実に上回り(最大8.08倍の高速化)、多くの場合デフォルト設定の推論エンジン(vLLMで4.05倍)に匹敵または凌駕する性能を示しました。しかし、同じ時間予算での単純なハイパーパラメータ探索(最大11.53倍)には及ばない結果となりました。
エージェントの軌跡を定性的に分析したところ、エージェントは多くの関連する最適化手法を列挙するものの、圧倒的に単一の推論フレームワークに収束する傾向があることがわかりました。彼らはわずか数個の異なる構成しかテストせず、残りの予算を再測定、修復、またはハイパーパラメータの最適化に費やし、大きく異なる戦略を探索することはありませんでした。これは、ボトルネックがドメイン知識ではなく、多様な構成を提案し、それらを体系的に評価し、最適な解決策を提出する能力にあることを示唆しています。
全体として、InferenceBenchは、記憶された解決策が限られた改善しかもたらさないオープンエンドなAIエンジニアリング環境でエージェントが動作する能力を反映しています。このベンチマークは、複雑で現実的な推論最適化タスクにおけるエージェントの性能を評価する新しい視点を提供するとともに、現在のエージェントが抱える探索能力の限界を浮き彫りにしています。