PGDG: 基于物理的数据生成用于从单次演示中实现鲁棒双臂策略学习
PGDG是一种新颖的数据生成框架,能够从单次演示中扩展出物理上合理、多样化的恢复行为数据集,无需额外人工标注。它通过物理采样子和数据策展器迭代优化,在双臂操作任务中显著优于传统空间增强方法,并支持GR00T等基础模型的微调。
近期,来自Cunxi Dai等研究人员提出了一种名为PGDG(Physically Grounded Data Generation)的数据生成框架,旨在解决双臂操作中行为克隆的难题。传统的模仿学习需要大量多样化演示数据,但收集成本高昂,且微小扰动易导致系统陷入无法恢复的状态。例如,在接触丰富的双臂操作中,即使微小的环境变化也可能使机器人偏离预设轨迹,进入缺乏恢复监督的流形外状态。PGDG通过零样本策展,从单次演示出发,自动生成一个紧凑的数据集,包含物理上合理、成功且多样化的恢复行为,无需额外人工标注。
PGDG的核心是一个迭代过程,结合了物理采样子和数据策展器。物理采样子利用物理模拟器,从当前采样分布中生成候选轨迹,并保留成功执行的任务轨迹。数据策展器则基于信息论标准,选择信息量大、非冗余且可恢复的行为,并据此更新采样分布,使其覆盖之前未充分采样的恢复模式。这一迭代过程持续进行,直到生成足够多样的恢复数据集。为进一步提升数据质量,PGDG还采用短视距采样控制,对选定的高风险状态重新标注纠正动作,从而有效避免了策略在执行过程中陷入死胡同。
在四项双臂操作任务中,PGDG在模拟环境和零样本真实世界迁移中均持续优于仅使用空间增强的方法。以RotateBox-Pitch任务为例,模拟环境中的成功率从38%提升至93%,真实世界中从35%提升至82%。此外,PGDG还能有效微调GR00T等基础模型,成功率从46%提升至77%,展示了其在机器人学习中的强大泛化能力。该研究为数据稀缺条件下的双臂操作策略学习提供了一种高效、鲁棒的解决方案,有望推动机器人学习在实际应用中的进一步发展。更多详细实验结果可访问项目网站:https://cunxid.github.io/PGDG/。