AI News HubLIVE
站內改寫1 分鐘閱讀

面向視覺-語言-動作模型的基於分析概念的顯式運動學引導

本文提出了一種用於視覺-語言-動作(VLA)模型的分析概念專家模組,透過3D資訊構建可執行的分析概念,提供顯式的運動學引導和密集獎勵,顯著提升了複雜操作任務的成功率和學習效率。

來源arXiv Robotics作者: Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

當前的視覺-語言-動作(VLA)模型大多依賴於二維輸入,忽視了三物理世界中豐富的物體結構資訊和常識性知識。這一缺陷限制了它們在複雜、高精度操作任務中的空間感知能力和適應性。為彌補這一關鍵差距,研究團隊構建了一個名為“概念專家”(Concept Expert)的模組,用於生成可執行的分析概念(Analytic Concepts),將物體表示為顯式、可程式設計的藍圖。該機制分為兩個協同階段:首先,在VLA推理之前,概念專家利用視覺基礎模型(Vision Foundation Models, VFMs)提取的三維資訊,估計物體的初始運動學和結構引數;其次,在整個操作過程中,VLA模型利用其固有能力動態跟蹤這些概念引數,並持續將其與觀測變化對齊,以確保持續精度。一旦建立,分析概念便透過兩種方式為VLA微調提供顯式、高質量的指導:(1)密集的程式化操作獎勵;(2)精確的空間引導。這種設計使VLA模型能夠學習物理上可互動的行為,同時保持端到端學習的靈活性。實驗結果表明,在監督學習和強化學習設定下,該方法均取得了成功率和學習效率的一致提升,證明了結構化、基於概念引導對VLA後訓練的有效性。該論文由Mingyang Sun等人撰寫,於2026年7月29日提交至arXiv,並歸入機器人學(cs.RO)領域。