AI News HubLIVE
站內改寫1 分鐘閱讀

MindVLA-U1:統一流式架構使VLA在自動駕駛中超越VA

MindVLA-U1是首個統一流式VLA架構,通過單一前饋過程同時生成自迴歸語言標記和流匹配連續動作軌跡,並採用逐幀流式處理和學習記憶通道來攜帶時間上下文。在WOD-E2E基準上,它以2次擴散步驟首次超越有經驗的人類駕駛員(RFS 8.20 vs 8.13),並在規劃ADE上大幅領先先前VA/VLA方法,同時保持16 FPS的吞吐量和自然語言接口。

來源arXiv Robotics作者: Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

自動駕駛技術已經從模塊化的流水線架構演進到端到端的統一模型,視覺-語言-動作(VLA)模型被視為這一進程的自然延伸。然而,在實際應用中,駕駛VLA模型在規劃質量上往往落後於更簡單的視覺-動作(VA)模型。研究人員指出,這一差距並非源於模型規模,而是因為語義推理、時間上下文和連續控制之間的整合方式存在問題——現有的VLA構建方式更像是孤立子任務的改進,未能組合成連貫的駕駛能力。

為了解決這個問題,研究團隊提出了MindVLA-U1,這是首個為自動駕駛設計的統一流式VLA架構。其核心是一個統一的視覺-語言-動作骨幹網絡(VLM),能夠在單一前饋過程中同時生成自迴歸語言標記和基於流匹配的連續動作軌跡,同時保留各模態的自然輸出形式。該架構採用流式設計,逐幀處理駕駛視頻而非固定的視頻-動作塊;一個可學習的記憶通道在幀間傳遞時間上下文,使得規劃軌跡能夠平滑演化,無需冗餘的多幀VLM建模。

MindVLA-U1還支持在稠密/稀疏混合變換器(MoT)骨幹上的快/慢執行,通過靈活的自注意力上下文管理實現。此外,它提供了一條可測量的語言到動作路徑:由語言預測的駕駛意圖通過無分類器引導(CFG)來引導動作擴散,將語言側的意圖轉化為連續軌跡生成的控制信號。

在長尾的WOD-E2E基準測試中,MindVLA-U1以僅2次擴散步驟首次超越有經驗的人類駕駛員(RFS 8.20 vs 8.13),在規劃ADE指標上大幅領先先前的VA/VLA方法,同時實現了16 FPS的吞吐量,接近RAP-DINO的18 FPS,並保留了自然語言接口。研究團隊表示,該項工作仍在進行中,更多細節已在項目頁面發佈。