跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

JAMB:用于双臂操作的联合动作-运动扩散策略

文章摘要

研究者提出JAMB,一种在共享Transformer中联合去噪双臂动作与未来3D点轨迹的扩散策略。通过将多模态表示统一到共享时空坐标系,动作与运动假设可在去噪过程中相互修正。在RoboTwin 2.0的16项仿真任务中,JAMB平均成功率达83.4%,比最强基线高23.9个百分点;在三个真实机器人任务上,分别比仅动作策略和辅助几何预测方法高50.0和21.2个百分点,并对杂乱场景和分布外背景表现出更强泛化能力。

来源arXiv Robotics作者: Chuyang Xiao, Peilin Meng, David Held
JAMB:用于双臂操作的联合动作-运动扩散策略
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

arXiv 于 2026 年 9 月 21 日发布了一篇机器人学领域的新论文,题为《JAMB: Joint Action-Motion Diffusion for Bimanual Manipulation》(联合动作-运动扩散用于双臂操作)。论文由 Chuyang Xiao 等三位作者完成,提交时间为 2026 年 9 月 21 日 19:11:38 UTC,论文编号 arXiv:2609.25322v1,属于 cs.RO(机器人学)分类,DOI 为 https://doi.org/10.48550/arXiv.2609.25322(由 arXiv 分配,尚待 DataCite 注册)。该文提供了 PDF 与实验性 HTML 版本,并可获取 TeX 源码。

论文要解决的问题是:协调的双臂操作非常困难,因为任意一条手臂的运动都会改变共享的三维场景,从而影响另一条手臂。然而,大多数扩散策略在生成动作时,并没有显式地建模这些未来的几何后果;而带有预测能力的变体,通常只把未来状态用做辅助监督或固定的条件输入。为弥补这一局限,作者提出了 JAMB——一种扩散策略,它同时去噪双臂动作和未来的三维点轨迹。通过让动作假设与轨迹假设在同一个共享的 Transformer 中共同演化,两者在整个去噪过程中可以相互提供信息并互相精化。作者还进一步将多模态表示统一到一个共享的时空坐标系中,以便在联合去噪期间进行几何感知的交互。这一设计使动作生成与对场景未来几何演变的预测不再是彼此分离的两个环节,而是在同一个去噪过程中彼此耦合、彼此校正。

在实验评估方面,作者在 RoboTwin 2.0 中的多种双臂操作任务以及一台真实世界机器人上对 JAMB 进行了测试,并与仅使用动作的策略以及采用不同状态表示和学习目标的其他未来预测方法进行了比较。在 16 个仿真任务上,JAMB 取得了平均 83.4% 的成功率,比最强基线高出 23.9 个百分点。在三个真实世界任务上,它分别比仅动作方法和辅助几何预测方法高出 50.0 个百分点和 21.2 个百分点。除了这些性能提升之外,JAMB 在杂乱场景和分布外背景上也表现出比所评估基线更强的泛化能力,这说明联合建模动作与运动轨迹不仅提升了任务成功率,也增强了策略在环境变化下的鲁棒性。

论文作者总结说,这些结果共同证明了其联合动作-运动建模框架在协调双臂操作中的有效性。项目的网站为 https://jam-bimanual.github.io/。需要注意的caveat是:该论文为 2026 年 9 月发布的新提交(v1),尚属预印本,尚未经过同行评审或正式发表,其 DOI 也仍处于待注册状态;因此上述实验结果与结论仍应视为预印本阶段的研究成果,后续可能需要独立复现与更广泛的验证。

展开要点与分析

文章情报

工程师进阶

要点

  • 在共享Transformer中联合去噪双臂动作和未来3D点轨迹,使二者相互促进。
  • 将多模态表示锚定在共享时空坐标系,支持几何感知的联合去噪。
  • 在16项RoboTwin 2.0仿真任务上平均成功率83.4%,领先最强基线23.9个百分点。
  • 真实世界任务分别比仅动作和辅助几何预测基线高50.0和21.2个百分点,泛化更好。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。