GROW:面向开放世界VLM智能体的状态-动作建模GRPO对齐框架
提出GROW框架,通过将轨迹分解为状态-动作样本并在样本间计算优势,解决标准GRPO在多轮强化学习中因完整轨迹过长导致的噪声问题,在超800项Minecraft任务中达到最优性能。
近年来,视觉语言模型(VLM)智能体在开放世界任务中取得了显著进展。这类任务通常需要多轮视觉感知与动作执行,例如在Minecraft游戏中完成复杂目标。然而,现有的方法主要依赖专家示范的监督微调(SFT),而先进的强化学习算法,特别是组相对策略优化(GRPO),尚未被有效地应用于多轮强化学习场景。这是因为标准GRPO要求使用完整的轨迹作为训练样本,导致上下文过长且包含大量噪声,从而影响了学习效率。
针对这一挑战,由Xiongbin Wu等作者提出的GROW框架应运而生。GROW是一个为开放世界VLM智能体设计的强化学习框架,其核心创新在于将收集到的完整轨迹分解为状态-动作样本,并在这些样本之间计算优势值,而不是将整个轨迹视为一个单一的实体。这种方法有效地解决了标准GRPO在长轨迹下的问题。此外,研究团队还提供了一种替代性分析,证明即使分组样本依赖于不同的局部状态而非相同的提示上下文,该优化目标在简化假设下仍然能够保留GRPO的核心相对策略优化信号,从而保证了算法的有效性。
在实验部分,研究团队在超过800项Minecraft任务上对GROW进行了评估,这些任务涵盖了从简单采集到复杂建造的多种类型。结果显示,GROW方法在所有任务上均取得了最先进的性能(SOTA),显著超越了基于SFT和标准GRPO的基线方法。这一成果充分验证了所提出的强化学习框架在开放世界VLM智能体中的有效性。
GROW的提出不仅为将先进RL算法引入多轮视觉语言任务开辟了新途径,也为未来在更复杂的开放世界环境中训练智能体提供了重要的技术支撑。它有望推动VLM智能体在游戏、机器人导航等实际应用中的进一步发展。未来的工作可以探索将GROW与多模态预训练模型结合,或将其应用于更复杂的长期规划任务。总体而言,GROW为VLM智能体的多轮强化学习提供了一种有效且实用的解决方案,具有重要的学术和应用价值。