GRASP(Gradient RelAxed Stochastic Planner)是一种针对学习型动力学模型(即世界模型)的新型梯度规划器,由Michael Psenka与Mike Rabbat、Aditi Krishnapriyan、Yann LeCun及Amir Bar合作完成。该工作旨在解决长视界规划中的关键难题,使基于梯度的规划在大规模世界模型上变得更加实用。
随着世界模型规模的扩大,它们能够预测高维视觉空间中的长序列未来观测,并跨任务泛化,但将其有效用于控制或规划仍面临脆弱性:优化变得病态,非贪婪结构导致局部最优,高维潜在空间引入细微失败模式。
长视界规划的主要挑战包括:首先,通过时间反向传播会导致梯度爆炸或消失,因为雅可比矩阵的条件数随视界指数增长。其次,任务越长,越需要非贪婪行为(如绕行),且优化空间维度增加,局部最优陷阱增多。更为关键的是,对于基于深度学习的世界模型,直接优化状态输入会引发对抗鲁棒性问题:世界模型对状态输入的梯度非常敏感,因为训练数据流形外的方向可能产生尖锐梯度,使得模型容易被愚弄。
针对这些问题,文章提出将动力学约束松弛为软约束,采用配置法(collocation)优化动作和状态序列,从而将深度计算图拆解为可并行计算的局部项,同时避免长链反向传播。然而,直接优化状态会导致对抗鲁棒性问题,因为世界模型在训练数据流形外的方向上梯度尖锐。
GRASP的核心洞察是,动作空间通常低维且被充分训练,因此动作梯度可靠;而状态梯度脆弱。因此,GRASP仅依赖动作雅可比,通过停止状态梯度并添加密集目标项来重塑损失函数。具体地,它结合了停止梯度的动力学损失和密集目标损失,并定期与原始串行目标同步微调。此外,GRASP在状态迭代中注入高斯噪声以增强探索,帮助跳出局部最优。
在Push-T任务上的实验显示,GRASP在视界长度从40到80时均取得最高成功率,且中位成功时间最短。例如,在H=50时,GRASP成功率43.4%(耗时15.2秒),而CEM为30.2%(96.2秒)、GD为37.6%(76.3秒)、LatCo仅4.2%(1114.7秒)。这些结果证明了GRASP在长视界规划中的有效性和效率。
未来工作包括扩展到扩散世界模型、采用更复杂的优化器与噪声策略,以及将GRASP集成到闭环系统或强化学习策略中。作者认为,世界模型规划器正处于文献成熟但实际应用未充分探索的黄金时期,GRASP是迈向实用化的重要一步。