MAPLE:端到端自动驾驶的潜在多智能体博弈
MAPLE是一个新颖的框架,通过在视觉-语言-动作模型的潜在空间中进行反应式多智能体展开,解决了端到端自动驾驶中闭环评估的脆弱性问题。该框架采用两阶段训练:基于真实轨迹的监督微调,以及结合全局和智能体特定奖励的强化学习,同时引入多样性奖励以鼓励新颖的规划行为。MAPLE无需外部模拟器,在Bench2Drive上实现了最先进的驾驶性能。
视觉-语言-动作(VLA)模型作为端到端运动规划器表现出色,但在闭环评估中往往表现脆弱,这主要是因为它们是在传统模仿学习框架下训练的。现有的闭环监督方法缺乏可扩展性,并且无法完全模拟反应式环境。为此,研究人员提出了MAPLE(潜在多智能体博弈),这是一个新颖的框架,用于在VLA模型的潜在空间中对动态驾驶场景进行反应式多智能体展开。在MAPLE中,自车和附近的交通智能体在多步时间跨度内独立控制,同时对场景中的其他智能体保持反应性,从而实现闭环训练。
MAPLE包含两个训练阶段:第一阶段,基于真实轨迹对潜在展开进行监督微调;第二阶段,使用强化学习,结合全局奖励和智能体特定奖励,这些奖励鼓励安全性、进度和交互真实性。此外,研究人员还引入了多样性奖励,鼓励模型生成可能不包含在记录驾驶数据中的规划行为。值得注意的是,MAPLE的闭环训练框架是可扩展的,并且不需要外部模拟器,因为外部模拟器运行成本高,且与现实世界的视觉保真度有限。
实验表明,MAPLE在Bench2Drive基准测试上取得了最先进的驾驶性能。该工作展示了可扩展的闭环多智能体博弈对于构建鲁棒的端到端自动驾驶系统的潜力。论文共有19页,包含9张图,是NeurIPS 2026的投稿作品,发表于arXiv,主题涵盖机器人学(cs.RO)和计算机视觉与模式识别(cs.CV)。该论文由Rajeev Yasarla等12位作者完成,于2026年5月13日提交,目前可在arXiv上获取全文。MAPLE的核心创新在于将多智能体博弈引入潜在空间,避免了传统模拟器的局限,为端到端自动驾驶的闭环训练提供了一种高效且可扩展的解决方案。