視覚・言語・行動モデルのための分析概念による明示的運動学ガイダンス
本論文は、視覚・言語・行動(VLA)モデルのために、3D情報から実行可能な分析概念を構築し、明示的な運動学ガイダンスと密な報酬を提供する概念専門家モジュールを提案し、複雑な操作タスクにおける成功率と学習効率を大幅に向上させる。
現在の視覚・言語・行動(VLA)モデルのほとんどは2D入力に依存しており、3D物理世界に内在する豊富な物体構造情報や常識的知識を無視しています。この欠陥により、複雑で高精度な操作タスクにおける空間認識と適応性が制限されています。この重要なギャップを埋めるために、研究チームはVLAのための「概念専門家」モジュールを構築し、物体を明示的でプログラム可能な設計図として表現する実行可能な分析概念を作成しました。このメカニズムは2つの相乗的なフェーズで動作します。まず、VLA推論の前に、概念専門家は視覚基礎モデル(VFM)からの3D情報を活用して、物体の初期運動学的および構造的パラメータを推定します。次に、操作プロセス全体を通じて、VLAモデルはその固有の能力を利用して動的な概念パラメータを追跡し、観測の変化に継続的に合わせて持続的な精度を確保します。分析概念が確立されると、次の2つの方法でVLA微調整のための明示的で高品質なガイダンスを提供します:(1)密なプログラム的操作報酬、(2)正確な空間ガイダンス。この定式化により、VLAモデルはエンドツーエンドの学習柔軟性を維持しながら、物理的に基づいた相互作用行動を学習できます。実験結果は、教師あり学習と強化学習設定の両方で成功率と学習効率の一貫した改善を示しており、構造化された概念ベースのガイダンスがVLAの事後学習に効果的であることを実証しています。本論文はMingyang Sunらによって執筆され、2026年7月29日にarXivに提出され、ロボティクス(cs.RO)分野に分類されています。