AI News HubLIVE
站内改写1 分钟阅读

MindVLA-U1:统一流式架构使VLA在自动驾驶中超越VA

MindVLA-U1是首个统一流式VLA架构,通过单一前馈过程同时生成自回归语言标记和流匹配连续动作轨迹,并采用逐帧流式处理和学习记忆通道来携带时间上下文。在WOD-E2E基准上,它以2次扩散步骤首次超越有经验的人类驾驶员(RFS 8.20 vs 8.13),并在规划ADE上大幅领先先前VA/VLA方法,同时保持16 FPS的吞吐量和自然语言接口。

来源arXiv Robotics作者: Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

自动驾驶技术已经从模块化的流水线架构演进到端到端的统一模型,视觉-语言-动作(VLA)模型被视为这一进程的自然延伸。然而,在实际应用中,驾驶VLA模型在规划质量上往往落后于更简单的视觉-动作(VA)模型。研究人员指出,这一差距并非源于模型规模,而是因为语义推理、时间上下文和连续控制之间的整合方式存在问题——现有的VLA构建方式更像是孤立子任务的改进,未能组合成连贯的驾驶能力。

为了解决这个问题,研究团队提出了MindVLA-U1,这是首个为自动驾驶设计的统一流式VLA架构。其核心是一个统一的视觉-语言-动作骨干网络(VLM),能够在单一前馈过程中同时生成自回归语言标记和基于流匹配的连续动作轨迹,同时保留各模态的自然输出形式。该架构采用流式设计,逐帧处理驾驶视频而非固定的视频-动作块;一个可学习的记忆通道在帧间传递时间上下文,使得规划轨迹能够平滑演化,无需冗余的多帧VLM建模。

MindVLA-U1还支持在稠密/稀疏混合变换器(MoT)骨干上的快/慢执行,通过灵活的自注意力上下文管理实现。此外,它提供了一条可测量的语言到动作路径:由语言预测的驾驶意图通过无分类器引导(CFG)来引导动作扩散,将语言侧的意图转化为连续轨迹生成的控制信号。

在长尾的WOD-E2E基准测试中,MindVLA-U1以仅2次扩散步骤首次超越有经验的人类驾驶员(RFS 8.20 vs 8.13),在规划ADE指标上大幅领先先前的VA/VLA方法,同时实现了16 FPS的吞吐量,接近RAP-DINO的18 FPS,并保留了自然语言接口。研究团队表示,该项工作仍在进行中,更多细节已在项目页面发布。