TeamTR: マルチエージェントLLM連携のための信頼領域ファインチューニング
本論文では、マルチエージェントLLMシステムの逐次ファインチューニングにおける構造的失敗モード——エージェント更新によるコンテキスト分布のシフトと、古いロールアウト評価による誤差の増幅——を解決する信頼領域フレームワークTeamTRを提案する。TeamTRは各更新後に軌跡を再サンプリングし、エージェントごとに発散制御を課すことで、改善の下限を保証し、平均7.1%の性能向上を達成する。
マルチエージェント大規模言語モデル(LLM)システムは複雑な推論タスクにおいて有望視されてきたが、最近の評価では単一モデルのベースラインを下回ることが多い。本研究では、共有コンテキストを持つチームにおける逐次ファインチューニングに構造的な失敗モードがあることを特定した。すなわち、あるエージェントを更新するとチームのコンテキスト分布が変化し、後続の更新をキャッシュされたロールアウトで評価すると、このミスマッチが増幅される。研究者らはこれを「複合的占有シフト」と命名し、古い占有による評価はエージェント数の二乗に比例するペナルティを生じるのに対し、中間占有による評価は線形スケーリングに低減されることを数学的に証明した。この発見は、マルチエージェントシステムの協調が困難である根本原因を明らかにしている。
この問題に対処するため、TeamTRと呼ばれる信頼領域フレームワークが提案された。TeamTRの核心的な革新は、各コンポーネントの更新後に軌跡を再サンプリングして評価が常に最新のコンテキスト分布に基づくようにし、さらにエージェントごとに発散制御を課すことで更新の過度な逸脱を防ぐ点にある。これにより、更新ごとおよび段階ごとの厳密な改善下限が保証される。複数のベンチマークタスクにおける実験では、TeamTRが単一エージェントおよび逐次ベースラインを平均7.1%上回り、協調退化の緩和に成功した。また、プラグアンドプレイのコンポーネント交換をサポートし、個別モジュールの柔軟なアップグレードや交換が可能である。本研究成果はICML 2026で採択され、9ページの論文で理論分析と実験検証が詳述されており、コードはGitHubで公開されている。マルチエージェントLLMの研究と実装に強固な基盤を提供するものである。