DiDrive:面向安全自动驾驶离线强化学习的风险感知分层扩散框架
DiDrive提出了一种分布引导的离线扩散框架,结合风险感知分层扩散(RHDif)架构与3DICE策略优化范式,用于缓解自动驾驶离线强化学习中的分布偏移、重尾风险、分布外动作生成和高维状态冗余。在CARLA基准高密度交通场景中,DiDrive相比IQL、CQL和Diffusion-QL等基线方法取得更优性能,达到85%成功率和4295.68平均奖励。
扩散模型近年来在自动驾驶领域受到广泛关注,因为它们能够捕捉多模态的行为先验,为复杂交通环境下的决策提供丰富的表达能力。然而,将扩散模型与离线强化学习(RL)相结合后,策略仍然面临多项挑战:分布偏移(distribution shift)导致模型在遇到与训练数据分布不一致的输入时表现不佳;重尾风险(heavy-tailed risk)使得偶发的极端事件难以被充分建模;分布外(OOD)动作生成可能引发安全隐患;此外,高维状态空间中的大量冗余信息也会干扰模型的判断。为了系统性地解决这些问题,Qisong Guo等六位研究者提出了一种名为DiDrive的分布引导离线扩散框架。
DiDrive由两个协同工作的组件构成。第一个组件是风险感知分层扩散(RHDif)架构,它在状态空间层面进行操作。RHDif由一个低层风险门控编码器和一个高层上下文调制器组成,前者负责筛选环境中的冗余信息,突出与安全性密切相关的威胁信号,后者则将上下文信息进行调制,使模型能够把注意力集中在关键的安全风险上。第二个组件是3DICE策略优化范式,它在动作空间层面发挥作用。3DICE通过样本内校准的引导、时空优化以及基于集成的候选排序机制,有效抑制了分布外动作的过估计问题,并缓解了训练过程中可能出现的梯度振荡,从而增强了策略的鲁棒性。
研究团队在CARLA仿真平台上进行了大量评估实验。实验结果显示,DiDrive在整体性能上优于IQL、CQL和Diffusion-QL等现有基线方法。尤其值得一提的是,在包含60辆车辆的高密度复杂交通场景中,DiDrive取得了85%的成功率和4295.68的平均奖励,相比其他方法有了显著提升。这些结果验证了DiDrive在处理高密度交通流和复杂道路情况时的有效性,也表明该框架具备为安全自动驾驶决策提供可靠支持的能力。
论文于2026年6月4日提交至arXiv,编号为2609.01609v1,全文共16页。值得注意的是,该研究归属于机器学习(cs.LG)与机器人学(cs.RO)两个交叉领域,并已通过arXiv平台获得数字对象标识符(DOI):10.48550/arXiv.2609.01609。除了PDF版本外,作者还提供了实验性的HTML页面和TeX源代码,方便研究社区复现和进一步探索。该方法的创新之处在于将风险感知机制引入分层扩散架构,同时在动作空间中采用多种正则化手段,形成了一个端到端的可训练系统。与以往将扩散模型仅作为策略表示的工作不同,DiDrive在状态空间和动作空间都设计了针对性的约束,使模型不仅能够拟合数据分布,还能主动规避潜在的风险区域。这种设计尤其适用于现实中数据分布不均、极端场景稀少的自动驾驶环境。尽管目前实验局限于仿真环境,该框架为后续在真实车队数据上的验证以及跨环境的泛化研究奠定了基础。总体而言,DiDrive为离线强化学习与扩散模型的结合提供了一条新的思路,特别是在安全性要求极高的自动驾驶领域,这一框架的提出具有重要的理论意义和实际应用潜力。