AI News HubLIVE
站内改写1 分钟阅读

驾驶意图增强规划导向强化学习

DIAL框架通过两阶段方法解决连续动作策略的模式崩溃问题:第一阶段利用意图条件流匹配和分类器无关引导扩展采样分布;第二阶段通过多意图GRPO保持多样性。在WOD-E2E评测中,意图CFG采样首次超越人类驾驶示范,多意图GRPO进一步提升留出集评分。

来源arXiv Robotics作者: Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu

来自arXiv的一项新研究提出DIAL(驾驶意图增强强化学习)框架,旨在解决连续动作策略在偏好对齐中的根本性瓶颈。当前基于单一示范轨迹训练的连续动作策略常常遭遇模式崩溃问题:采样结果高度集中在示范动作周围,无法生成语义上不同的替代方案。这一限制严重影响了基于偏好评估的最佳N性能——即使使用理想的选择器,也无法从缺失的采样分布中恢复出多样化的动作。

DIAL框架采用两阶段方法来应对这一挑战。在第一阶段,研究者将流匹配动作头条件化于离散的意图标签,并引入分类器无关引导(CFG),从而沿着不同的操作模式扩展采样分布,有效打破了单示范模式崩溃。第二阶段通过多意图组相对策略优化(GRPO)将扩展后的分布引入偏好强化学习,该优化覆盖每个偏好组内的所有意图类别,防止微调过程重新坍缩至当前偏好模式。

实验在端到端驾驶任务WOD-E2E上进行,DIAL与多种基线进行了对比。视觉到动作(VA)和视觉语言动作(VLA)的监督微调(SFT)基线在最佳128采样时均低于人类驾驶示范;最强的先前方法RAP在最佳64采样时评分为8.5。而意图CFG采样在最佳128采样时将评分提升至9.14,首次同时超越了先前最优(RAP 8.5)和人类示范(8.13)。多意图GRPO进一步将留出集评分从7.681提升至8.211,而所有单意图基线不仅峰值更低,而且在训练后期出现性能下降。

这些结果表明,偏好强化学习在基于示范训练的连续动作策略上的瓶颈不仅在于如何更新策略,更在于如何扩展并保护被优化的采样分布。DIAL框架为自动驾驶等连续控制任务提供了一种新颖且有效的解决方案,其成功证明了离散意图引导在保持策略多样性方面的关键作用。