GRACE: 基于扩散-MPPI联合后验均值估计的无梯度机器人动作生成
GRACE是一种新方法,通过结合扩散模型和模型预测路径积分(MPPI)控制,仅使用前向成本评估来引导预训练的扩散策略,从而处理非可微的部署约束,如碰撞检测和关节限制。该方法在仿真中取得了更高成功率,并在真实7自由度机械臂上成功避开障碍物。
近年来,扩散策略在机器人动作生成中展现出强大能力,能够从示范数据中学习多模态动作序列。然而,在部署阶段,这些策略通常需要借助可微的引导成本来适应安全约束,这限制了其应用范围,因为许多实际约束(如二进制碰撞检测、关节限制及黑盒滚动成本)是不可微的。为了解决这一问题,研究人员提出了GRACE(Gradient-free Robot Action generation via Combined diffusion-MPPI posterior mean Estimation),一种无需梯度即可引导预训练扩散策略的新方法。
GRACE的核心思想是将扩散模型的得分上升结构与模型预测路径积分(MPPI)控制相结合。在每个逆向步骤中,GRACE构建一个以成本为条件的引导后验分布,并通过以扩散逆向均值为中心的单次MPPI更新来估计其均值。当成本可微时,GRACE在一阶匹配协方差近似下可恢复传统的梯度引导。该方法仅需前向成本评估,无需计算梯度,从而支持各种非可微约束。
实验结果表明,GRACE在仿真环境中取得了比纯扩散策略和基于采样的基线更高的成功率。在真实7自由度机械臂上,GRACE成功避开了部署时出现的障碍物,而未经过引导的原始策略在每次试验中均与障碍物发生碰撞。此外,研究团队已公开代码和实验视频,以供进一步验证和应用。
GRACE的提出为机器人安全部署提供了一种灵活且有效的解决方案,有望推动扩散策略在复杂现实场景中的广泛应用。该方法不仅解决了非可微约束的难题,还避免了梯度计算的高昂成本,使得扩散策略可以更便捷地应用于实际机器人系统中。未来,研究团队计划进一步优化GRACE的计算效率,并探索其在更多机器人任务中的应用潜力。