Sling2Sim2Real:用于非破坏性弹弓策略学习的一次性弹性系统辨识
Sling2Sim2Real是一种新型框架,能够通过一次非破坏性交互识别弹性物体参数,从而在仿真中学习策略并零样本迁移到真实机器人。该方法解决了弹性行为在真实世界与仿真之间难以标定的问题,而仅凭视觉观测无法区分弹性属性。该框架包括两个阶段:多起始点的Real2Sim系统辨识(利用参数协方差估计弹性属性),以及基于仿真的策略学习与零样本Sim2Real迁移。在Franka Emika Panda机械臂和不同弹性带的弹弓操作任务上,实验表明Sling2Sim2Real实现了准确的策略学习和鲁棒的泛化能力,同时显著减少了真实世界交互次数。
弹性物体操控(EOM)涉及高维度、非线性的弹性形变,其变形特性多样,导致状态空间巨大,需要大量探索才能学习准确的操作策略,例如弹弓操作。传统方法中,在真实机器人上进行反复试验(如多次发射弹丸)不仅成本高昂,还可能造成损坏。仿真环境虽然允许大规模、安全的探索,但精确标定真实世界与仿真之间的弹性行为极具挑战,因为弹性属性仅凭视觉观测难以区分。
针对这些挑战,研究者提出了Sling2Sim2Real框架。该框架通过一次非破坏性交互(例如拉伸橡皮筋)即可辨识弹性物体的物理参数,从而在仿真环境中学习策略。框架分为两个阶段:首先,一种多起始点的Real2Sim系统辨识方法利用参数间的协方差来估计弹性属性。与传统的试错方法不同,该方法仅需一次拉伸即可获取关键参数,避免了重复试验带来的损耗。参数协方差的利用提高了辨识的鲁棒性,即使初始猜测不准确也能收敛到正确值。其次,在标定好的仿真器中进行策略学习,通过强化学习训练策略,然后零样本迁移至真实机器人,无需任何调整。
实验采用Franka Emika Panda机械臂和具有不同物理特性的弹性带(包括不同硬度、不同长度),在多种目标距离(从近到远)下执行弹弓操作任务。结果显示,Sling2Sim2Real实现了准确的策略学习和鲁棒的泛化能力,同时大幅减少了所需的真实世界交互次数。该工作已被IROS 2026接收,为弹性物体操控提供了一种高效、非破坏性的解决方案。