本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

ThunderAgent:大規模合成データ生成のための2倍高速なエージェント推論

記事の要約

ThunderAgentは、エージェント推論のためのプログラム認識スケジューラです。各エージェントワークフローをスケジュール可能なプログラムとして扱うことで、KVキャッシュスラッシングを排除し、2倍以上のシングルノードスループットとほぼ線形のマルチノードスケーリングを実現します。

ThunderAgent:大規模合成データ生成のための2倍高速なエージェント推論
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

ThunderAgentは、高スループットのエージェント推論を実現するシステムです。LLMがエージェントとしてますます広く展開される中(Claude Code、Codexなど)、大規模な合成データ生成がこれらのエージェントを訓練する鍵となっています。しかし、既存の推論エンジンはリクエストレベルでスケジューリングを行い、マルチターンワークフローを認識できないため、KVキャッシュスラッシングやマルチノード間の負荷不均衡などの問題が生じます。ThunderAgentはプログラム抽象化によってこれらの問題を解決します。各エージェントワークフローをスケジュール可能なプログラムとして抽象化し、その実行フェーズ、KVキャッシュフットプリント、ノード配置を追跡します。メモリプレッシャー下では、プログラムレベルのアドミッション制御によって優先度の低いワークフローを一時停止し、キャッシュ競合を減らしてヒット率を大幅に向上させ、レイテンシを低減します。一時停止したワークフローを再開する際は、グローバル待機キューを介して最も空き容量のあるノードにルーティングし、クラスタ全体の負荷をバランスします。評価の結果、単一の8×H100ノードでは、バッチサイズ192でThunderAgentが803 token/sのスループットを達成したのに対し、SGLangは390 token/sにとどまり、レイテンシは65秒から10.6秒に低減しました。マルチノードクラスタでは、2ノードから8ノードへのスケールで、ThunderAgentの高速化率は1.79倍から2.39倍に拡大し、スループットはGPU数にほぼ比例して増加しました。ThunderAgentは既存のスタックに簡単に統合できるよう設計されており、OpenAI互換のエンドポイントや量子化、投機的復号などの最適化と連携します。クライアント側ではprogram_idフィールドを追加するだけで済みます。このプロジェクトはオープンソース化されており、SkyRLやNVIDIA Dynamoなどのフレームワークに採用されています。著者らはプログラム抽象化が次世代のエージェント推論システムの基盤になると考えています。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • エージェントLLMリクエストスケジューリングのためのプログラム抽象化を導入し、KVキャッシュスラッシングを排除
  • シングルノードで最大2.5倍のスループット向上、8ノードクラスタで2.4倍の高速化を達成
  • program_idフィールドを追加するだけで既存の推論バックエンドと互換性あり
  • ICML 2026でスポットライト論文として採択

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。