跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

基于梯度的世界模型长时域规划

文章摘要

GRASP是一种新的基于梯度的规划器,用于学习动力学(世界模型),通过将轨迹提升到虚拟状态实现并行优化、向状态迭代添加随机性进行探索,并重塑梯度以避免高维视觉模型中脆弱的状态输入梯度。该方法使长时域规划变得更加实用。

来源BAIR Blog
基于梯度的世界模型长时域规划
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

世界模型(World Model)作为学习到的动力学模拟器,正变得越来越强大。它们能够在高维视觉空间中预测长序列的未来观测,并以过去难以想象的方式跨任务泛化。然而,拥有强大的预测模型并不等同于能够有效地用于控制或规划。长时域规划在实践中仍然脆弱:优化变得病态,非贪心结构导致糟糕的局部极小值,高维潜在空间引入微妙的失败模式。

针对这些问题,来自伯克利AI研究团队(BAIR)的Michael Psenka、Mike Rabbat、Aditi Krishnapriyan、Yann LeCun和Amir Bar提出了GRASP(Gradient RelAxed Stochastic Planner),一种基于梯度的随机规划器。GRASP通过三种创新设计使长时域规划变得实用:提升轨迹到虚拟状态、向状态迭代添加随机性以及重塑梯度。

世界模型与规划挑战

世界模型是一种学习模型,给定当前状态和未来动作序列,预测接下来会发生什么。在规划中,最简单的做法是通过模型展开动作序列并最小化终端误差。但长时域展开会创建深而病态的计算图,导致梯度爆炸或消失。此外,长时域任务通常需要非贪心行为(如绕过障碍物),这使得损失景观充满局部陷阱。

一种自然的解决方案是采用搭配法(Collocation),将动力学约束作为软约束,同时优化动作和状态序列。搭配法允许并行计算所有时间步,且梯度不再通过深层展开回传,避免了长期依赖问题。然而,对于基于深度学习的世界模型,直接优化状态会遭遇对抗鲁棒性问题:状态输入梯度极其脆弱,因为训练过程只正则化数据流形切向方向,而法向方向的行为不受约束,导致模型对未见过状态高度敏感。

GRASP的核心创新

GRASP建立在搭配法框架之上,但针对深度学习模型的梯度特性进行了专门设计。其关键洞察是:虽然状态梯度不可靠,但动作梯度通常是良好行为的,因为动作空间维数低且训练充分。因此,GRASP仅依赖动作梯度进行规划。

GRASP包含两个主要成分:

  1. 状态噪声探索:在优化过程中向虚拟状态更新注入高斯噪声,帮助跳跃到不同的损失盆地,同时动作仍由梯度引导。
  2. 梯度重塑:停止状态到世界模型的梯度传播,避免对抗脆弱性。同时添加密集目标项(鼓励每一步向目标靠近),与停止梯度的动力学损失平衡,防止陷入琐碎解。

此外,GRASP每K次迭代进行一次短期的“同步”修正:从初始状态使用当前动作展开,对原始序列损失进行少量梯度步,使状态和动作保持与真实轨迹一致。

实验结果

在Push-T任务上,GRASP与CEM、标准梯度下降(GD)和LatCo等方法进行了比较。结果显示,随着规划时域增加,GRASP在成功率和规划速度上均显著优于其他方法。例如,当时域H=60时,GRASP成功率达到26.2%,而CEM仅为7.2%,GD为16.4%;同时GRASP的中位成功时间仅为49.1秒,远快于其他方法。GRASP在长时域下不仅成功率更高,而且规划更快。

未来展望

研究者认为,目前是利用世界模型进行规划的有趣时期:经典规划与控制文献非常成熟,但现代大规模世界模型上的纯规划优化仍待充分探索。未来方向包括扩展到扩散世界模型、采用更先进的优化器和噪声策略,以及将GRASP集成到闭环系统或强化学习策略中。

展开要点与分析

文章情报

工程师进阶

要点

  • GRASP通过虚拟状态提升实现并行优化,显著加速长时域规划。
  • 通过向状态注入高斯噪声促进探索,避免陷入局部最优。
  • 停止状态梯度传播,仅使用动作梯度,避免深度学习模型的对抗脆弱性。
  • 在Push-T任务中,GRASP在长时域下成功率更高且耗时更短。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。