AI News HubLIVE
サイト内リライト1 分で読了

MindVLA-U1:統一ストリーミングアーキテクチャによりVLAが自動運転でVAを凌駕

MindVLA-U1は、最初の統一ストリーミングVLAアーキテクチャです。単一の前方パスで自己回帰言語トークンとフローマッチング連続動作軌跡を生成し、フレーム単位でビデオを処理し、学習されたメモリチャネルで時間的文脈を伝達します。WOD-E2Eベンチマークにおいて、2回の拡散ステップで初めて熟練人間ドライバーを上回り(RFS 8.20 vs 8.13)、計画ADEで従来のVA/VLA手法を大きく凌駕し、VAクラスのスループット(16 FPS)を維持しつつ自然言語インターフェースを保持します。

ソースarXiv Robotics著者: Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

自動運転技術はモジュール型パイプラインからエンドツーエンドの統合へと進化しており、Vision-Language-Action(VLA)モデルはその自然な延長線上にあります。しかし実際には、運転用VLAモデルは計画品質においてVision-to-Action(VA)モデルに劣ることが多く、その原因はモデル規模ではなく、意味推論、時間的文脈、そして連続制御を組み合わせる方法にあると研究者らは指摘します。既存のVLAは孤立したサブタスクの改善に過ぎず、統合された運転能力を形成できていないのです。

本研究では、自動運転向け初の統一ストリーミングVLAアーキテクチャ「MindVLA-U1」を提案します。その中核となる統一VLMバックボーンは、単一の前方パスで自己回帰言語トークンとフローマッチングに基づく連続動作軌跡を同時生成し、各モダリティの自然な出力形式を保持します。ストリーミング設計は運転ビデオをフレーム単位で処理し、学習されたメモリチャネルがフレーム間で時間的文脈を伝達することで、冗長なマルチフレームVLMモデリングなしに軌跡をスムーズに進化させます。

MindVLA-U1は、密/疎Mixture-of-Transformers(MoT)バックボーン上で高速/低速実行を可能にし、柔軟な自己注意コンテキスト管理を提供します。さらに、言語予測された運転意図が分類器フリーガイダンス(CFG)による行動拡散を導く、測定可能な言語から行動への経路を実現し、言語側の意図を連続軌跡生成の制御信号に変換します。

長尾のWOD-E2Eベンチマークにおいて、MindVLA-U1はわずか2回の拡散ステップで初めて熟練人間ドライバーを上回り(RFS 8.20 vs 8.13)、計画ADEで従来のVA/VLA手法を大きく凌駕し、VAクラスのスループット(16 FPS、RAP-DINOの18 FPSに匹敵)を維持しつつ自然言語インターフェースを保持します。研究チームは、本作業は進行中であり、プロジェクトページで詳細を公開しています。