掩碼擴散語言模型成為智能體強化學習中強大且可操控的文本世界模型
強化學習領域需要多樣化的訓練環境,但傳統手工設計的環境難以擴展。自迴歸世界模型存在從左到右的偏差,無法充分利用全局狀態信息。一項新研究提出使用掩碼擴散語言模型(MDLM)作為文本世界模型,通過雙向錨點感知去噪,在連貫性和多樣性上顯著優於參數規模大4倍的語言模型,並引入GRPO訓練框架實現高達47%的零樣本遷移性能提升。該工作已開源。
強化學習(RL)的快速發展催生了對多樣化、專業化訓練環境的迫切需求。傳統手工設計的固定任務和獎勵難度的環境,在模型性能提升後難以提供有效信號,而長時域下的稀疏獎勵容易導致模型在特定工作流或工具結構上發生模式坍塌。世界模型通過模擬環境狀態,在純 rollout 性能上已能與現實環境媲美,因此有望按需擴展多樣性。然而,自迴歸(AR)世界模型存在從左到右的偏見,無法基於全局相互依賴的狀態錨點(如工具模式、先前回合和預期結果)進行條件生成。
本研究將基於文本的世界建模形式化為一個可控的過渡動力學問題,分解為初始狀態、任務上下文、工具模式、領域規則和引導指令五個組成部分。同時,團隊整理了涵蓋9個開源環境和12個前沿模型家族的239,403個有狀態的行-動軌跡。通過對比AR語言模型和掩碼擴散語言模型(MDLM),研究發現MDLM憑藉雙向錨點感知去噪機制,在連貫性、基礎真實性以及經驗驗證的 rollout 多樣性方面,均優於參數規模大4倍的大型語言模型(LLM),且推理延遲相近。
研究還引入了一種即插即用的GRPO訓練框架,結合確定性狀態檢查,並在三個分佈外環境(ScienceWorld、ALFWorld、AppWorld)上,針對三種1.2B-7B規模的智能體基座(LFM2.5、Qwen3、Mistral)進行了零樣本遷移消融實驗。結果表明,無需環境特定微調,該方法相較於基線模型實現了高達47%的絕對性能提升。此外,團隊對對抗場景下的失敗模式進行了行為分析,並開展了關於真實感、結果正確性和訓練實用性的人工評估。相關工作和代碼已全部開源,以推動該領域的進一步研究。