AI News HubLIVE
站內改寫1 分鐘閱讀

MindGames Arena泛化賽道:In2AI解決方案採用延遲逐步獎勵歸因

本文提出了一種延遲逐步獎勵歸因方法,結合資格門控、非同步rollout生成等,使8B引數開源模型在NeurIPS 2025 MindGames Arena基準測試中擊敗GPT-5等大型系統,贏得雙賽道第一。

來源arXiv AI作者: Aliaksei Korshuk, Alexander Buyantuev, Ilya Makarov

在多智慧體戰略互動任務中,語言模型智慧體的訓練面臨重大挑戰:每個動作的質量可能取決於從未發生的未來事件、違反遊戲規則的移動或其他玩家的決策。標準強化學習假設每一步都可以分配獎勵,但這一假設在結果跨時間和智慧體交織的場景中失效。

本研究引入了一種延遲逐步獎勵歸因方法,結合資格門控機制,構建了完整的回合生命週期和後處理流水線:僅在回合結束時計算獎勵,根據任務特定語義將獎勵傳播回原始步驟,並排除缺乏有效依賴資訊的步驟。此外,透過vLLM的連續批處理實現非同步rollout生成、基於課程的對手取樣以及多層級分層批次構建,該方法在多智慧體環境中實現了穩定且樣本高效的強化學習訓練。

在NeurIPS 2025的MindGames Arena基準測試中,一個僅有80億引數的開源模型經過該方法訓練後,在直接對抗中匹配甚至超越了包括GPT-5在內的顯著更大的專有系統,並在開放賽道(無限制)和高效賽道(≤8B引數)均獲得第一名。