VLAMotor:基于测试引导的视觉-语言-动作模型增强方法(通过智能体数据合成)
VLAMotor是一种新型框架,用于增强视觉-语言-动作(VLA)模型。它通过距离感知测试暴露失败模式,并利用智能体合成数据微调模型。在模拟和真实机器人操作任务中,VLAMotor显著提高了失败检测率和任务成功率。
视觉-语言-动作(VLA)模型在机器人操作领域展现出巨大潜力,但其数据驱动的特性使得模型在部署后容易遇到训练数据未覆盖的边缘情况而失败。现有研究大多停留在故障检测阶段,缺乏将已发现的故障用于模型修复的机制。针对这一局限,研究人员提出了VLAMotor框架,这是首个将距离感知测试与智能体数据合成相结合的VLA增强分析框架。
VLAMotor的工作流程分为两个阶段。首先,在故障暴露阶段,框架通过计算输入样本与训练数据之间的距离来估计不确定性,并结合不确定性排名与冗余消除策略,构建紧凑的测试集以暴露多样化的故障模式。在模拟实验中,VLAMotor生成的测试用例中有92.33%成功触发了VLA模型的故障,测试覆盖率相比当前最先进的工具提升了18.93%。
其次,在模型修复阶段,VLAMotor将故障轨迹抽象为结构化语义表示,并规划参数化的修复技能序列。这些序列通过逆运动学计算和运动执行转化为可实际运行的轨迹。执行成功的轨迹会被自动标注,用于对原始VLA模型进行微调,从而得到增强后的新模型。
在四个典型的机器人操作任务上进行的评估表明,使用故障案例生成的合成数据进行微调后,VLA模型在模拟环境中的整体成功率提升了49.25%。更值得关注的是,在真实硬件部署中,经过模拟增强的模型相较于原始模型,成功率提升了57.50%,充分证明了VLAMotor作为一种低成本、高效VLA增强方法的有效性。
相关论文由Zeqin Liao等九位作者共同完成,于2026年5月16日提交至arXiv,编号为2606.00053,归属机器人学(cs.RO)领域。该研究为VLA模型的实际部署提供了一条可行且经济的增强路径。