私たちは、ラッシュアワーの高速道路で強化学習(RL)制御された100台の車両を展開し、渋滞を緩和し全ドライバーの燃料消費を削減しました。目標は、原因が不明ながら渋滞と大きなエネルギー浪費を引き起こす「ストップ・アンド・ゴー」波に対処することです。効率的な流れ平滑化コントローラーを訓練するため、RLエージェントが対話する高速なデータ駆動型シミュレーションを構築し、スループットを維持しながら人間ドライバーの周りで安全に動作しつつエネルギー効率を最大化することを学習させました。
全体として、適切に制御された少数の自動運転車(AV)で、道路上の全ドライバーの交通の流れと燃費を大幅に改善できます。さらに、訓練されたコントローラーはほとんどの現代車に展開可能で、標準的なレーダーセンサーに依存した分散方式で動作します。最新の論文では、この100台の実験を通じて、シミュレーションから実地までの大規模RLコントローラー展開の課題を探求しています。
ファントム渋滞の課題 ストップ・アンド・ゴー波は、運転行動の小さな変動が交通流で増幅されることで発生します。反応時間がゼロでないため、前車より強くブレーキを踏むことがあり、これが後続車に増幅され、最終的に完全停止に至ります。これらの波は後方に伝播し、頻繁な加速によるエネルギー効率低下、CO2排出増加、事故リスク上昇を引き起こします。従来のアプローチ(ランプメータリングや可変速度制限)は高コストなインフラと集中調整を必要としますが、AVはよりスケーラブルな解決策を提供します。ただし、AVを人間ドライバーに挿入するだけでは不十分で、全員にとって交通を改善するスマートな運転が必要であり、ここでRLが重要になります。
波平滑化AVのための強化学習 RLでは、エージェントが環境との相互作用を通じて報酬信号を最大化することを学習します。私たちの環境は混合自律交通シナリオであり、AVはストップ・アンド・ゴー波を抑制し、自身と周辺の人間運転車両の燃料消費を削減する運転戦略を学習します。訓練には現実的な交通ダイナミクスを再現する高速シミュレーションが必要であり、テネシー州ナッシュビル近郊のI-24高速道路で収集した実験データを活用し、車両が高速道路の軌跡を再現するシミュレーションを構築しました。
AVは展開を考慮して設計され、自車速度、先行車速度、車間距離という基本的なセンサー情報のみで動作できます。RLエージェントはこれらの入力に基づいて瞬間加速度または目標速度を指示します。ローカル測定のみを使用する主な利点は、追加インフラなしでほとんどの現代車に分散展開できることです。
報酬設計 最も困難な部分は、最大化されたときにAVに求める複数の目的(波平滑化、エネルギー効率、安全性、運転快適性、人間運転規範への準拠)と整合する報酬関数を設計することです。各項の適切な係数を見つける必要があります。例えば、燃料消費最小化が報酬を支配すると、RL AVは高速道路の中央で停止することを学習します(エネルギー最適だから)。これを防ぐため、動的最小・最大車間距離しきい値を導入し、AV後方の人間運転車両の燃料消費をペナルティして利己的行動を抑制しました。最終的に、エネルギー節約と合理的で安全な運転行動のバランスを目指しています。
シミュレーション結果 AVが学習する典型的な行動は、人間ドライバーよりわずかに大きい車間距離を維持し、迫り来る急な減速をより効果的に吸収することです。シミュレーションでは、このアプローチにより混雑シナリオで全道路利用者の燃料消費を最大20%削減し、AV比率は5%未満でした。これらのAVは特別な車両である必要はなく、スマートアダプティブクルーズコントロール(ACC)を装備した標準的な量産車で十分であり、これを大規模にテストしました。
100台AV実地テスト:RLの大規模展開 有望なシミュレーション結果を受け、シミュレーションから高速道路への橋渡しを行いました。訓練済みRLコントローラーを100台の車両に搭載し、I-24高速道路で数日間ピーク時に展開しました。この大規模実験「MegaVanderTest」は、これまでで最大の混合自律交通平滑化実験です。展開前の手順は以下の通りです:データ駆動型シミュレーションでの訓練とロバスト性検証、ロボット工学ソフトウェアでの検証後、車両のオンボードクルーズコントロールを介して制御するハードウェア展開、下流交通状況を考慮した速度計画ガイドとRLコントローラーを組み合わせた階層型システム「MegaController」への統合、注意深い人間監視下での実路検証とフィードバックに基づく調整。
検証後、RLコントローラーは100台の車両に展開され、I-24高速道路で朝のラッシュアワーに走行しました。周辺交通は実験に気付かず、偏りのないドライバー行動を確保しました。実験中、高速道路沿いの多数のオーバーヘッドカメラからデータを収集し、コンピュータービジョンパイプラインを通じて数百万の個別車両軌跡を抽出しました。軌跡から算出されたメトリクスは、AV周辺での燃料消費低減傾向を示し、シミュレーション結果および以前の小規模検証展開と一致しています。例えば、AVの後方を走行する人間ドライバーほど平均燃料消費が低くなっています。速度と加速度の分散を測定することで波の振幅低減も確認され、実地データからは制御車両周辺で15~20%の省エネ傾向が観測されました。
最終所見 100台の実地運用テストは分散型で、AV間の明示的な協調や通信はなく、現在の自動運転展開を反映し、よりスムーズでエネルギー効率の高い高速道路に一歩近づきました。しかし、改善の余地はまだ大きいです。より高速で正確な人間運転モデルによるシミュレーションのスケールアップは、シミュレーションと現実のギャップを埋めるために重要です。AVに追加の交通データ(高度なセンサーや集中計画)を装備することで、コントローラーの性能をさらに向上できるでしょう。マルチエージェントRLは協調制御戦略の改善に有望ですが、5Gネットワークを介したAV間の明示的通信が安定性をさらに向上させ、ストップ・アンド・ゴー波を緩和できるかは未解決の問題です。重要なのは、私たちのコントローラーが既存のACCシステムとシームレスに統合され、大規模な実地展開を可能にしていることです。スマートな交通平滑化制御を搭載した車両が増えれば、道路上の波は減り、汚染と燃料消費が削減されます!
MegaVanderTestの実現には多くの貢献者が参加しました。完全なリストはCIRCLESプロジェクトページで入手できます。