无需真实世界数据:通过合成视频场景学习多样化的人形机器人任务
研究人员提出一种新框架,利用生成式AI将文本提示转换为逼真多样的人体运动序列,使人形机器人无需真实数据即可学习多种任务执行风格。在四个仿真场景中,机器人成功完成任务并展现出对复杂运动变化的强适应性。
人形机器人因其类人形态而拥有敏捷和多功能运动的巨大潜力,但复杂技能的获取成为主要瓶颈。传统的从演示中学习(Learning-from-Demonstrations)方法高度依赖真实世界数据,然而收集这些数据成本高昂,且难以捕捉特定动作的行为模式,同时不同个体提供的演示往往缺乏多样性。更为复杂的是,即便对于同一任务,人类也可能采用多种截然不同的运动策略。为此,研究人员提出了一种基于生成式AI的新框架,旨在从根本上解决数据稀缺与多样性不足的问题。该框架通过将自然语言文本提示(例如“拿起杯子”或“走路绕过障碍物”)输入至生成模型,模型输出逼真且多样的人体运动序列,这些序列以视频形式呈现,涵盖同一任务的不同执行风格。机器人通过观察这些合成演示,学习任务的目标和运动策略,从而获得广泛的技能库,无需任何真实演示或人类干预。研究团队在四个仿真环境中测试了该方法的有效性,这些环境设计了不同的难度和运动复杂度。结果显示,机器人不仅在标准任务上表现优异,更展示出对复杂运动变化(如物体位置偏移、环境干扰等)的强适应性,成功泛化到未见过的情况。这项研究已被2026年IEEE/ASME先进智能机电一体化国际会议(AIM)接收,标志着人形机器人学习领域的重要进展。该框架不仅降低了数据获取成本,还提高了学习多样性和鲁棒性,为未来人形机器人在服务、工业和探索等领域的广泛应用铺平了道路。研究者计划进一步在真实平台上测试,并探索与强化学习等技术的结合。