AI News HubLIVE
站内改写1 分钟阅读

MoMo:通过时空动作标记化实现机器人操作中的运动模式调节

机器人需根据任务、物体和交互环境调整操作方式,而不仅限于精确执行。本文提出MoMo,一个两阶段模仿学习框架,包含时空动作标记器和行为克隆Transformer,可输入连续的运动模式条件。在六个真实机器人操作任务中,改变该条件可产生稳定、动态及中间行为,且人类评估者能够区分。在仅演示一种模式的任务上,MoMo能转移未见过的请求模式,同时基本保持任务成功率,展示了任务-模式组合的泛化能力。

机器人要在多样化的环境中有效工作,不仅需要精确完成操作任务,还要根据具体任务、物体和交互环境调整行为方式。这种执行层面的变化能否被学习并作为可复用的行为因素共享于不同任务之间?苹果机器学习研究团队发表的论文《MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization》对此进行了探索。

MoMo是一个两阶段的模仿学习框架。第一阶段是时空动作标记器(spatiotemporal action tokenizer),将连续的机器人动作序列离散化为具有时间和空间结构的令牌。第二阶段是一个行为克隆Transformer,它以任务指令和连续的运动模式条件作为输入,输出相应的动作令牌序列,从而生成符合期望运动模式的操作。

研究团队在六个真实机器人操作任务上进行了实验,包括抓取、放置、推拉等。通过调整输入的运动模式条件,机器人可以表现出稳定(steady)、动态(dynamic)以及介于两者之间的中间行为。这些行为差异可以通过关节速度、加速度和末端执行器的接近俯仰角等指标量化,并且人类评估者能够根据操作风格进行区分。

关键实验之一是测试MoMo的跨任务泛化能力。当某个任务仅在单一运动模式下演示(例如只演示稳定模式)时,MoMo能够成功地将从未见过的运动模式(例如动态模式)应用于该任务,同时基本保持任务成功率。这表明运动模式可以作为独立于任务的因素进行学习和复用。

该研究证实了运动模式可以作为一种可复用的行为控制因子,在不同操作技能之间迁移,从而提升了机器人行为多样性和适应性。未来,这种框架有望降低机器人演示数据收集成本,并增强机器人在复杂环境中的灵活性。