面向视觉-语言-动作模型的基于分析概念的显式运动学引导
本文提出了一种用于视觉-语言-动作(VLA)模型的分析概念专家模块,通过3D信息构建可执行的分析概念,提供显式的运动学引导和密集奖励,显著提升了复杂操作任务的成功率和学习效率。
来源arXiv Robotics作者: Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun
当前的视觉-语言-动作(VLA)模型大多依赖于二维输入,忽视了三物理世界中丰富的物体结构信息和常识性知识。这一缺陷限制了它们在复杂、高精度操作任务中的空间感知能力和适应性。为弥补这一关键差距,研究团队构建了一个名为“概念专家”(Concept Expert)的模块,用于生成可执行的分析概念(Analytic Concepts),将物体表示为显式、可编程的蓝图。该机制分为两个协同阶段:首先,在VLA推理之前,概念专家利用视觉基础模型(Vision Foundation Models, VFMs)提取的三维信息,估计物体的初始运动学和结构参数;其次,在整个操作过程中,VLA模型利用其固有能力动态跟踪这些概念参数,并持续将其与观测变化对齐,以确保持续精度。一旦建立,分析概念便通过两种方式为VLA微调提供显式、高质量的指导:(1)密集的程序化操作奖励;(2)精确的空间引导。这种设计使VLA模型能够学习物理上可交互的行为,同时保持端到端学习的灵活性。实验结果表明,在监督学习和强化学习设置下,该方法均取得了成功率和学习效率的一致提升,证明了结构化、基于概念引导对VLA后训练的有效性。该论文由Mingyang Sun等人撰写,于2026年7月29日提交至arXiv,并归入机器人学(cs.RO)领域。