世界模型(World Model)作为学习到的动力学模拟器,正变得越来越强大。它们能够在高维视觉空间中预测长序列的未来观测,并以过去难以想象的方式跨任务泛化。然而,拥有强大的预测模型并不等同于能够有效地用于控制或规划。长时域规划在实践中仍然脆弱:优化变得病态,非贪心结构导致糟糕的局部极小值,高维潜在空间引入微妙的失败模式。
针对这些问题,来自伯克利AI研究团队(BAIR)的Michael Psenka、Mike Rabbat、Aditi Krishnapriyan、Yann LeCun和Amir Bar提出了GRASP(Gradient RelAxed Stochastic Planner),一种基于梯度的随机规划器。GRASP通过三种创新设计使长时域规划变得实用:提升轨迹到虚拟状态、向状态迭代添加随机性以及重塑梯度。
世界模型与规划挑战
世界模型是一种学习模型,给定当前状态和未来动作序列,预测接下来会发生什么。在规划中,最简单的做法是通过模型展开动作序列并最小化终端误差。但长时域展开会创建深而病态的计算图,导致梯度爆炸或消失。此外,长时域任务通常需要非贪心行为(如绕过障碍物),这使得损失景观充满局部陷阱。
一种自然的解决方案是采用搭配法(Collocation),将动力学约束作为软约束,同时优化动作和状态序列。搭配法允许并行计算所有时间步,且梯度不再通过深层展开回传,避免了长期依赖问题。然而,对于基于深度学习的世界模型,直接优化状态会遭遇对抗鲁棒性问题:状态输入梯度极其脆弱,因为训练过程只正则化数据流形切向方向,而法向方向的行为不受约束,导致模型对未见过状态高度敏感。
GRASP的核心创新
GRASP建立在搭配法框架之上,但针对深度学习模型的梯度特性进行了专门设计。其关键洞察是:虽然状态梯度不可靠,但动作梯度通常是良好行为的,因为动作空间维数低且训练充分。因此,GRASP仅依赖动作梯度进行规划。
GRASP包含两个主要成分:
- 状态噪声探索:在优化过程中向虚拟状态更新注入高斯噪声,帮助跳跃到不同的损失盆地,同时动作仍由梯度引导。
- 梯度重塑:停止状态到世界模型的梯度传播,避免对抗脆弱性。同时添加密集目标项(鼓励每一步向目标靠近),与停止梯度的动力学损失平衡,防止陷入琐碎解。
此外,GRASP每K次迭代进行一次短期的“同步”修正:从初始状态使用当前动作展开,对原始序列损失进行少量梯度步,使状态和动作保持与真实轨迹一致。
实验结果
在Push-T任务上,GRASP与CEM、标准梯度下降(GD)和LatCo等方法进行了比较。结果显示,随着规划时域增加,GRASP在成功率和规划速度上均显著优于其他方法。例如,当时域H=60时,GRASP成功率达到26.2%,而CEM仅为7.2%,GD为16.4%;同时GRASP的中位成功时间仅为49.1秒,远快于其他方法。GRASP在长时域下不仅成功率更高,而且规划更快。
未来展望
研究者认为,目前是利用世界模型进行规划的有趣时期:经典规划与控制文献非常成熟,但现代大规模世界模型上的纯规划优化仍待充分探索。未来方向包括扩展到扩散世界模型、采用更先进的优化器和噪声策略,以及将GRASP集成到闭环系统或强化学习策略中。