跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

感知哪种模态至关重要:面向鲁棒VLA策略的证据门控正则化

文章摘要

视觉-语言-动作(VLA)策略在有限的、同质的机器人演示上训练时,容易学习到传感器之间的虚假相关性,而不是任务相关信号;这种失败模式被称为“模态纠缠”。为应对真实世界中的遮挡与干扰,该论文提出证据门控正则化(EGR),一种零推理开销的训练目标。EGR 利用逐帧、逐传感器的任务相关性估计,对低证据传感器施加不变性约束、对高证据传感器施加单传感器充分性约束。在基于 BEHAVIOR-1K 的基准测试和两套真实机器人平台上,EGR 显著提升成功率:单传感器回退场景提升 120%,双臂平台在物理干扰下提升 183%。

来源arXiv Robotics作者: Yue Yang, Diego Romeres, Chiori Hori, Gedas Bertasius, Daniel Szafir, Siddarth Jain
感知哪种模态至关重要:面向鲁棒VLA策略的证据门控正则化
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

视觉-语言-动作(Vision-Language-Action,VLA)模型将视觉、语言和动作执行结合起来,是机器人学习领域备受关注的方向。然而,这类模型的实际部署仍面临一个隐性风险:当机器人依赖多路传感器输入时,模型可能会“偷懒”地利用传感器之间的统计关联来推断动作,而非真正理解任务。由于机器人演示数据的采集成本高,训练集通常规模有限且同质化严重,这种倾向会使模型学到大量虚假的跨传感器相关性。这篇由Yue Yang等六位作者撰写、于2026年9月2日提交至arXiv的论文,将这些虚假相关导致的失败统称为模态纠缠。

模态纠缠在真实环境中会表现为两种棘手问题。第一种是干扰敏感性:当一个与任务无关的传感器被遮挡、损坏或加入干扰时,策略的输出会明显波动,出现意料之外的错误;第二种是单模态不充分性:当只有某一路真正携带任务信息的传感器可用时,模型又因为过度依赖其他传感器的相关性而无法独立完成判断。换言之,模型的鲁棒性被“平均主义”的传感器融合方式削弱了。

针对上述问题,论文提出证据门控正则化(Evidence-Gated Regularization,EGR)。该训练目标并不局限于某一种模态,而是先为每一帧、每一个传感器计算一个任务相关性的“证据”信号,再用这个信号门控两类状态条件一致性约束:在低证据传感器上施加不变性约束,要求策略对该传感器的扰动始终保持一致的行为;在高证据传感器上施加单传感器充分性约束,鼓励策略在仅仅使用该传感器时也能达到足够好的决策效果。EGR在推理时不引入任何额外计算开销,因此可以相对直接地用于现有的VLA策略训练流程。

为了让这一问题得到更系统的评测,作者构建了一个基于BEHAVIOR-1K的基准,既包含无需完整执行即可快速诊断的推理测试套件,也包含47个需要完整rollout的长程技能任务,专门针对模态纠缠现象进行压力测试。此外,论文还在两套构型完全不同的真实机器人平台上验证了EGR的有效性:一套是使用两台Kinova机械臂和三个RGB摄像头的双臂系统;另一套是采用单臂MELFA ASSISTA、融合视觉与GelSight触觉传感器的单臂系统。

在BEHAVIOR-1K仿真环境中,EGR带来了稳定且显著的成功率提升:完整模态下成功率从12.5%提升至16.4%,相对提升约31%;无信息相关传感器被破坏时,成功率从9.4%提升至16.5%,相对提升约75%;而仅在单一相关传感器可用时,成功率从2.8%提升至6.1%,相对提升约120%。真实机器人实验中还额外加入了物理物体作为干扰源。结果表明,EGR在双臂系统上的成功率从30%提升至85%,相对提升达183%;在融合触觉传感器的单臂系统上,成功率从55%提升至70%,相对提升27%。

综合来看,本文通过“识别哪些传感器真正起作用”的思路,为多模态机器人策略的鲁棒性提供了一条轻量且有效的新路径。与许多需要改变模型结构或增加测试时计算的方法不同,EGR把工作重心放在训练阶段,不改变推理时的输入管线。论文作者也希望,这种显式关注“模态是否可靠”的训练方式,能帮助VLA策略在真实、开放且充满干扰的环境中更加稳定地完成操纵任务。

展开要点与分析

文章情报

工程师进阶

要点

  • 在有限且同质的机器人演示上训练的VLA策略,会学习到虚假的跨传感器相关性,这种失败被称作“模态纠缠”。
  • 证据门控正则化(EGR)通过逐帧、逐传感器的任务相关性门控一致性目标,且推理时零额外开销。
  • 在仿真中,EGR将完整模态下的成功率从12.5%提升到16.4%,无信息传感器损坏时从9.4%提升到16.5%,单传感器回退时从2.8%提升到6.1%。
  • 在真实机器人上,EGR将双臂Kinova平台在物理干扰下的成功率从30%提高到85%,将MELFA ASSISTA触觉平台从55%提高到70%。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。