AI News HubLIVE
サイト内リライト2 分で読了

DiDrive:自動運転における安全なオフライン強化学習のためのリスク認識型階層拡散フレームワーク

DiDriveは、分布誘導型のオフライン拡散フレームワークであり、リスク認識型階層拡散(RHDif)アーキテクチャと3DICEポリシー最適化を組み合わせることで、分布シフト、裾の重いリスク、OOD行動生成、高次元状態冗長性といった課題に対処する。CARLAベンチマークでは、IQL、CQL、Diffusion-QLなどのベースラインを上回り、60台の車両が走る高密度交通シナリオで成功率85%、平均報酬4295.68を達成している。

ソースarXiv Machine Learning著者: Qisong Guo, Jingtang Chen, Zhilin Chen, Pei Xu, Mingjian Fu, Wenxi Liu, Yuanlong Yu

拡散モデルは、自動運転における多峰的な行動の事前分布を効果的に捉えることができますが、オフライン強化学習(RL)と組み合わせる場合、ポリシーは分布シフト、裾の重いリスク信号、分布外(OOD)行動生成、高次元の状態冗長性などの影響を受けやすいという問題があります。これらの課題に取り組むため、Qisong Guo氏ら6名の研究者は「DiDrive」と呼ばれる分布誘導型オフライン拡散フレームワークを提案しました。DiDriveは、リスク認識型階層拡散(RHDif)アーキテクチャと3DICEポリシー最適化という、相互補完的な2つの要素で構成されています。

状態空間では、RHDifの低レベル・リスクゲートエンコーダが環境内の冗長な情報を除去し、高レベル・文脈変調器が安全上重要な脅威に注意を集中させます。これにより、エージェントは周囲の無関係な要素に惑わされることなく、差し迫った危険に反応できるようになります。行動空間では、3DICEがサンプル内較正ガイダンス、時空間最適化、アンサンブルに基づく候補ランキングを導入し、OOD行動の過大評価を防ぎつつ、学習中の勾配振動を低減してポリシーの安定性を高めます。こうした設計は、車両が次に取るべき安全な行動を決定するための堅牢なポリシーを生み出すことを目的としています。

研究チームは、自動運転のベンチマークとして広く使われているCARLAシミュレータ上で実験を実施しました。DiDriveはIQL、CQL、Diffusion-QLなどの既存ベースラインと比較され、特に60台の車両が行き交う高密度交通シナリオにおいて顕著な性能向上を示しました。この難しい環境では、成功率85%、平均報酬4295.68を記録し、従来手法を大きく上回る結果となっています。これは、危険度の高い運転環境における分布誘導型拡散モデルの可能性を強調するものです。

論文は全16ページで、2026年6月4日にarXivへ提出されました。識別子は2609.01609v1であり、機械学習(cs.LG)とロボティクス(cs.RO)の分野に分類されています。また、arXiv発行のDOI(10.48550/arXiv.2609.01609)も付与されています。著者らはPDFのほか、実験的なHTML版とTeXソースも公開しており、コミュニティによる再現性やさらなる研究を促進しています。DiDriveは、状態空間の認識と行動空間の意思決定を統合した階層的アプローチにより、自動運転におけるオフラインRLの安全な展開に向けた明確な道筋を示しています。今後は、実世界のデータセットでの検証や、他の安全性重視分野への応用が期待されます。