AI News HubLIVE
站内改写2 分钟阅读

从流式意图中产生动作行为

研究者将动作涌现形式化为端到端自动驾驶的目标能力,并提出流式意图机制,通过语义链式推理和时间一致性生成多样化、可控的动作。其模型SI在Waymo基准测试中取得有竞争力的性能,并首次展示了意图忠实可控性。

来源arXiv Robotics作者: Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Xie Yan, Benjin Zhu

在一篇新近提交至arXiv的论文中,来自多位作者的研究团队正式定义了端到端自动驾驶中的“动作涌现”概念。所谓动作涌现,是指系统能够通过场景条件推理,生成物理上可行、语义上恰当且符合安全规范的驾驶动作,而不是依赖对已学习场景-动作映射的简单检索或插值。这一能力被视为自动驾驶系统迈向真正智能的关键一步,因为它要求模型在面对任意长尾交通场景时,能够基于对环境的深层理解自主推导出合适的动作,而非机械地匹配记忆中的模式。

论文指出,现有的主流范式均无法实现真正的动作涌现。自回归轨迹解码器虽然能够生成连续轨迹,但往往会将本质上多模态的未来可能性坍缩为单一的平均输出,丢失多样性。而扩散模型和流匹配生成器虽然能够表达多模态性,但其生成过程无法由推理出的驾驶意图进行引导或控制。换言之,这些方法虽然能产生多种结果,但缺乏一种机制来根据场景理解有意图地选择或调整行为。

为了克服这一局限,研究者提出了“流式意图”(Streaming Intent)机制。该机制的核心思想是让驾驶意图以两种方式“流式”传递:首先,在语义层面,通过一个连续的思维链,从场景理解中因果推导出意图,使得意图的生成具有可解释的推理过程;其次,在时间层面,意图在连续的视频片段间进行时间流式传输,确保意图承诺在完整的驾驶视界内保持一致性,不会因片段切换而出现矛盾。

具体实现上,研究者构建了一个名为SI(Streaming Intent)的视觉-语言-动作(VLA)模型。SI首先自回归地解码一个四步思维链,并输出一个意图令牌。该意图令牌随后用于驱动一个流匹配动作头上的无分类器引导(CFG)过程。得益于流匹配的高效性,仅需两个去噪步骤即可生成最终的轨迹。这种设计不仅保证了生成的高效性,更关键的是实现了意图对动作的显式控制。

在Waymo端到端自动驾驶基准测试中,SI模型取得了有竞争力的表现:在验证集上RFS得分为7.96,测试集上为7.74。然而,更引人注目的是该模型首次在完全端到端的VLA框架中展示了“意图忠实可控性”。这意味着对于同一个固定场景,当在推理时改变输入的意图类别时,模型能够生成定性上完全不同但质量始终高的规划方案。这一能力完全来源于数据驱动学习,无需任何预构建的轨迹库或手工设计的后处理选择器。这一突破为自动驾驶中的可控行为生成开辟了全新的路径,有望推动更安全、更灵活的人机共驾系统的发展。