AI News HubLIVE
站內改寫1 分鐘閱讀

MindGames Arena泛化賽道:In2AI解決方案採用延遲逐步獎勵歸因

本文提出了一種延遲逐步獎勵歸因方法,結合資格門控、異步rollout生成等,使8B參數開源模型在NeurIPS 2025 MindGames Arena基準測試中擊敗GPT-5等大型系統,贏得雙賽道第一。

來源arXiv AI作者: Aliaksei Korshuk, Alexander Buyantuev, Ilya Makarov

在多智能體戰略交互任務中,語言模型智能體的訓練面臨重大挑戰:每個動作的質量可能取決於從未發生的未來事件、違反遊戲規則的移動或其他玩家的決策。標準強化學習假設每一步都可以分配獎勵,但這一假設在結果跨時間和智能體交織的場景中失效。

本研究引入了一種延遲逐步獎勵歸因方法,結合資格門控機制,構建了完整的回合生命週期和後處理流水線:僅在回合結束時計算獎勵,根據任務特定語義將獎勵傳播回原始步驟,並排除缺乏有效依賴信息的步驟。此外,通過vLLM的連續批處理實現異步rollout生成、基於課程的對手採樣以及多層級分層批次構建,該方法在多智能體環境中實現了穩定且樣本高效的強化學習訓練。

在NeurIPS 2025的MindGames Arena基準測試中,一個僅有80億參數的開源模型經過該方法訓練後,在直接對抗中匹配甚至超越了包括GPT-5在內的顯著更大的專有系統,並在開放賽道(無限制)和高效賽道(≤8B參數)均獲得第一名。