AI News HubLIVE
站内改写1 分钟阅读

掩码扩散语言模型成为智能体强化学习中强大且可操控的文本世界模型

强化学习领域需要多样化的训练环境,但传统手工设计的环境难以扩展。自回归世界模型存在从左到右的偏差,无法充分利用全局状态信息。一项新研究提出使用掩码扩散语言模型(MDLM)作为文本世界模型,通过双向锚点感知去噪,在连贯性和多样性上显著优于参数规模大4倍的语言模型,并引入GRPO训练框架实现高达47%的零样本迁移性能提升。该工作已开源。

来源arXiv AI作者: Darshan Deshpande

强化学习(RL)的快速发展催生了对多样化、专业化训练环境的迫切需求。传统手工设计的固定任务和奖励难度的环境,在模型性能提升后难以提供有效信号,而长时域下的稀疏奖励容易导致模型在特定工作流或工具结构上发生模式坍塌。世界模型通过模拟环境状态,在纯 rollout 性能上已能与现实环境媲美,因此有望按需扩展多样性。然而,自回归(AR)世界模型存在从左到右的偏见,无法基于全局相互依赖的状态锚点(如工具模式、先前回合和预期结果)进行条件生成。

本研究将基于文本的世界建模形式化为一个可控的过渡动力学问题,分解为初始状态、任务上下文、工具模式、领域规则和引导指令五个组成部分。同时,团队整理了涵盖9个开源环境和12个前沿模型家族的239,403个有状态的行-动轨迹。通过对比AR语言模型和掩码扩散语言模型(MDLM),研究发现MDLM凭借双向锚点感知去噪机制,在连贯性、基础真实性以及经验验证的 rollout 多样性方面,均优于参数规模大4倍的大型语言模型(LLM),且推理延迟相近。

研究还引入了一种即插即用的GRPO训练框架,结合确定性状态检查,并在三个分布外环境(ScienceWorld、ALFWorld、AppWorld)上,针对三种1.2B-7B规模的智能体基座(LFM2.5、Qwen3、Mistral)进行了零样本迁移消融实验。结果表明,无需环境特定微调,该方法相较于基线模型实现了高达47%的绝对性能提升。此外,团队对对抗场景下的失败模式进行了行为分析,并开展了关于真实感、结果正确性和训练实用性的人工评估。相关工作和代码已全部开源,以推动该领域的进一步研究。