AI News HubLIVE
サイト内リライト1 分で読了

MindGames Arena一般化トラック:遅延ステップ単位報酬帰属を用いたIn2AIソリューション

本論文では、遅延ステップ単位報酬帰属手法を提案し、vLLMの連続バッチ処理による非同期ロールアウト生成などを組み合わせることで、NeurIPS 2025のMindGames Arenaベンチマークにおいて、8BパラメータのオープンソースモデルがGPT-5などの大規模システムを上回り、両トラックで1位を獲得した。

ソースarXiv AI著者: Aliaksei Korshuk, Alexander Buyantuev, Ilya Makarov

マルチエージェント戦略的インタラクションのための言語モデルエージェントの訓練には、各行動の質が実現しない将来の出来事やルール違反の動き、他プレイヤーの決定に依存するという根本的な困難がある。標準的な強化学習では各ステップで報酬を割り当てられると仮定するが、結果が時間とエージェントを超えて絡み合う設定ではこの仮定は成り立たない。

本研究では、エリジビリティゲーティングを備えた遅延ステップ単位報酬帰属を導入し、エピソードライフサイクルと後処理パイプラインを構築する。エピソード終了時にのみ報酬を計算し、タスク固有の意味に従って元のステップに伝播し、有効な依存情報がないステップを訓練から除外する。さらに、vLLMの連続バッチ処理による非同期ロールアウト生成、カリキュラムベースの対戦相手サンプリング、マルチレベル層別バッチ構築を組み合わせることで、マルチエージェント環境で安定したサンプル効率的なRL訓練を実現する。

NeurIPS 2025のMindGames Arenaベンチマークにおいて、本手法で訓練された80億パラメータのオープンソースモデルは、GPT-5を含む大幅に大規模な専有システムと対等または凌駕し、オープントラック(無制限)と効率的トラック(≤8Bパラメータ)の両方で1位を獲得した。