跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

FailureSpot:面向视觉-语言-动作模型的标签高效时间戳级故障检测

文章摘要

视觉-语言-动作(VLA)模型在长时程机器人操作中仍可能不可预测地失败,现有检测方法常因轨迹级标签的监督错配而失效。FailureSpot提出一种标签高效的框架,先利用无标注动作块生成弱监督信号,再通过主动学习挑选最不确定的轨迹进行时间戳级标注,从而在降低标注成本的同时提升故障检测精度。

来源arXiv Robotics作者: Jie Ma, Zongxi Liu, Yi Zhu
FailureSpot:面向视觉-语言-动作模型的标签高效时间戳级故障检测
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

一项名为 FailureSpot 的新研究提出了一种标签高效的视觉-语言-动作(VLA)模型故障检测方法,旨在解决机器人长时程操作中故障预测的时间戳级定位难题。该论文由 Jie Ma 等三位作者撰写,于2026年9月3日提交至 arXiv,编号为 2609.04277,归属机器人学(cs.RO)和计算机视觉(cs.CV)领域。

VLA 策略在通用机器人操作中展现出强大潜力,但在长时间执行过程中仍可能不可预测地失败。为了安全部署,可靠的故障检测至关重要。现有方法通常依赖视觉模型,这类模型往往只能在错误动作已经发生之后才检测到故障;另一种思路是使用基于 VLA 内部表征训练的轻量级主动检测器。然而,这些主动检测方法通常使用轨迹级标签进行监督,导致在不成功轨迹中,故障发生前的正常行为也会被错误地标记为故障。这种监督不匹配引入了标签噪声,既限制了轨迹级检测的准确性,也妨碍了精确到时间戳的故障定位。

为此,研究团队聚焦于细粒度的时间戳级 VLA 故障检测,同时应对密集标注成本过高的问题。他们提出了一种数据高效的框架,首先利用无标注的 VLA 动作块构建基于动作的弱监督信号,捕捉多种异常模式,例如连续动作块不一致、动作冻结或停滞、以及激进的随机运动。然后,通过主动学习仅筛选出最不确定的轨迹进行时间戳级标注,并利用这些信息量丰富的标签对检测器进行微调。

实验在多种 VLA 策略上开展,结果表明该方法同时提升了时间戳级和轨迹级的故障检测性能。这一工作为机器人安全操作提供了更具实用性的故障预警手段,有望在真实世界部署中减少因动作异常导致的意外后果。FailureSpot 的代码和数据关联信息可在 arXiv 论文页面获取,论文还提供了 PDF 和实验性 HTML 版本供读者查阅。

展开要点与分析

文章情报

工程师进阶

要点

  • VLA策略在长期执行中仍需可靠的故障检测,现有视觉模型通常只能在错误动作发生后发现问题。
  • 基于VLA内部表示的轻量级主动检测器多使用轨迹级标签,导致失败前正常行为被误标为故障,引入标签噪声。
  • FailureSpot利用动作块构造弱监督信号,并通过主动学习选择关键轨迹进行时间戳级标注,兼顾标注效率与检测性能。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。