跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

GRASP:基于梯度的长视界世界模型规划器

文章摘要

GRASP是一种针对学习型动力学(世界模型)的新型梯度规划器,通过提升轨迹到虚拟状态实现时间并行优化、在状态迭代中加入随机性以探索、重塑梯度以避免高维视觉模型中的脆弱状态输入梯度,使长视界规划变得实用。文章详细分析了长视界规划面临的梯度爆炸/消失、非贪婪局部最优以及对抗鲁棒性问题,并介绍了GRASP的解决方案。

来源AIhub作者: BAIR blog
GRASP:基于梯度的长视界世界模型规划器
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

GRASP(Gradient RelAxed Stochastic Planner)是一种针对学习型动力学模型(即世界模型)的新型梯度规划器,由Michael Psenka与Mike Rabbat、Aditi Krishnapriyan、Yann LeCun及Amir Bar合作完成。该工作旨在解决长视界规划中的关键难题,使基于梯度的规划在大规模世界模型上变得更加实用。

随着世界模型规模的扩大,它们能够预测高维视觉空间中的长序列未来观测,并跨任务泛化,但将其有效用于控制或规划仍面临脆弱性:优化变得病态,非贪婪结构导致局部最优,高维潜在空间引入细微失败模式。

长视界规划的主要挑战包括:首先,通过时间反向传播会导致梯度爆炸或消失,因为雅可比矩阵的条件数随视界指数增长。其次,任务越长,越需要非贪婪行为(如绕行),且优化空间维度增加,局部最优陷阱增多。更为关键的是,对于基于深度学习的世界模型,直接优化状态输入会引发对抗鲁棒性问题:世界模型对状态输入的梯度非常敏感,因为训练数据流形外的方向可能产生尖锐梯度,使得模型容易被愚弄。

针对这些问题,文章提出将动力学约束松弛为软约束,采用配置法(collocation)优化动作和状态序列,从而将深度计算图拆解为可并行计算的局部项,同时避免长链反向传播。然而,直接优化状态会导致对抗鲁棒性问题,因为世界模型在训练数据流形外的方向上梯度尖锐。

GRASP的核心洞察是,动作空间通常低维且被充分训练,因此动作梯度可靠;而状态梯度脆弱。因此,GRASP仅依赖动作雅可比,通过停止状态梯度并添加密集目标项来重塑损失函数。具体地,它结合了停止梯度的动力学损失和密集目标损失,并定期与原始串行目标同步微调。此外,GRASP在状态迭代中注入高斯噪声以增强探索,帮助跳出局部最优。

在Push-T任务上的实验显示,GRASP在视界长度从40到80时均取得最高成功率,且中位成功时间最短。例如,在H=50时,GRASP成功率43.4%(耗时15.2秒),而CEM为30.2%(96.2秒)、GD为37.6%(76.3秒)、LatCo仅4.2%(1114.7秒)。这些结果证明了GRASP在长视界规划中的有效性和效率。

未来工作包括扩展到扩散世界模型、采用更复杂的优化器与噪声策略,以及将GRASP集成到闭环系统或强化学习策略中。作者认为,世界模型规划器正处于文献成熟但实际应用未充分探索的黄金时期,GRASP是迈向实用化的重要一步。

展开要点与分析

文章情报

工程师进阶

要点

  • GRASP通过提升动力学约束为软约束,实现时间并行计算,缓解长视界带来的梯度问题。
  • 在状态优化中注入高斯噪声,帮助跳出局部最优,同时保持动作梯度清晰。
  • 通过停止状态梯度并引入密集目标项,避免对抗性鲁棒问题,并定期与真实轨迹同步。
  • 实验表明,GRASP在长视界任务中成功率更高且耗时更短。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。