AI News HubLIVE
站内改写1 分钟阅读

时空最优传输注意力:面向接触丰富操作的视触模仿学习

该论文提出一种三模态融合框架SO-TA,用最优传输替代softmax注意力,显著提升机器人在紧密装配、连接器插入等接触丰富任务中的性能,在扰动下保持高成功率。

来源arXiv Robotics作者: Yue Feng, Weicheng Huang, I-Ming Chen

在机器人操作领域,接触丰富的任务——如紧密间隙的插入、连接器的配对、抛光以及曲面擦拭——对数据驱动的控制器来说仍然是一大挑战。这些任务不仅涉及不连续的接触动力学,还面临部分可观测性和严格的安全约束。单一传感模态无法满足所有需求:视觉在接触前提供全局上下文,力/力矩(F/T)反馈在接触后主导交互,而本体感觉位姿则提供一致的运动学骨干。然而,大多数先前的模仿学习策略仅使用单模态或双模态信号,少数融合三模态的方法通常采用现成的注意力模块,但并未明确如何跨任务相关区域分配注意力质量。

为了解决这一问题,本文提出了时空最优传输注意力(SO-TA),一种三模态融合骨干网络。SO-TA的核心创新在于用熵正则化最优传输(OT)对齐力-位姿派生的子查询与视觉块,替代了传统的softmax归一化块注意力。显式的边际约束作为一种结构化的归纳偏置,能够促进条件感知的空间选择,使得模型在光照变化、干扰物和部分遮挡下仍能保持稳定。这种机制不仅提升了注意力分配的精确性,还增强了模型对复杂环境的鲁棒性。

SO-TA与基于扩散的序列策略相结合,将观测窗口映射到位姿动作块。研究者在三个真实机器人任务上评估了SO-TA:紧密销孔装配、BCM接线连接器插入以及曲面标记擦除。每个条件进行约200次试验,结果显示,SO-TA在紧密销孔装配任务中达到了100%的成功率,而在相同容量下交叉注意力仅为93%;在光照、干扰物和部分遮挡扰动下,SO-TA仍保持了82.5%的成功率,而拼接基线则降至43.5%。此外,OT导出的块热图以及留一模态影响比提供了可解释的、阶段相关的诊断信息,为任务阶段的诊断和调试提供了有力依据。

这项研究的意义在于,SO-TA通过最优传输理论为多模态融合提供了结构化的先验,显著提升了机器人执行复杂接触任务的能力。未来,该方法有望在更广泛的工业应用中发挥作用。