跳到主要內容
AI News HubLIVE
站內改寫3 分鐘閱讀

擴展強化學習用於交通平滑:100輛自動駕駛汽車的高速公路部署

文章摘要

我們部署了100輛強化學習(RL)控制的車輛進入高峯時段的高速公路交通,以緩解擁堵並降低所有人的燃油消耗。通過數據驅動的模擬訓練,RL智能體學會了在保持通行能力和安全性的同時最大化能效。實地測試表明,少量經過良好控制的自動駕駛汽車(AV)即可顯著改善交通流和燃油效率,節省高達15-20%的能量。

來源BAIR Blog
擴展強化學習用於交通平滑:100輛自動駕駛汽車的高速公路部署
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

我們成功部署了100輛由強化學習(RL)控制的車輛,在高峯時段的高速公路車流中緩解擁堵並降低燃油消耗。目標直指那些令人沮喪的“走走停停”波浪——這些看似無原因的減速和加速會導致擁堵和巨大的能源浪費。為了訓練有效的流量平滑控制器,我們構建了快速、數據驅動的模擬環境,讓RL智能體在其中交互學習,在保持通行能力和安全駕駛的同時最大化能效。

總體而言,一小部分經過良好控制的自動駕駛汽車(AV)就足以顯著改善所有道路使用者的交通流和燃油效率。更重要的是,這些訓練好的控制器設計為可部署在大多數現代車輛上,以去中心化方式運行,僅依賴標準雷達傳感器。在我們的最新論文中,我們探討了在這項100車實驗中從模擬到實地大規模部署RL控制器所面臨的挑戰。

“幽靈堵車”的挑戰 如果你開車,肯定經歷過走走停停波浪的困擾。這些波浪通常由駕駛行為中的微小波動通過交通流放大引起。由於非零的反應時間,我們可能比前車剎車更猛,導致後車同樣動作,最終在後方形成完全停止。這些波浪向後傳播,導致頻繁加速帶來的能效下降、CO2排放增加和事故風險上升。傳統方法如匝道控制和可變限速需要昂貴的基礎設施和集中協調,而AV提供了一種更可擴展的方案——但它們必須更智能地駕駛,這正是RL的用武之地。

用於波浪平滑AV的強化學習 RL是一種強大的控制方法,智能體通過與環境的交互學習最大化獎勵信號。在我們的場景中,環境是混合自主交通,AV學習策略以抑制走走停停波浪並減少自身和附近人類駕駛車輛的燃油消耗。訓練需要快速模擬,我們基於田納西州納什維爾附近I-24高速公路的實驗數據構建了模擬環境,車輛重演高速公路軌跡,產生不穩定交通供後方AV學習平滑。

AV的設計注重可部署性,僅需自身速度、前車速度和車間距等基本傳感器信息。RL智能體據此輸出瞬時加速度或期望速度。僅使用本地測量的關鍵優勢是控制器可在大多數現代車輛上以去中心化方式部署,無需額外基礎設施。

獎勵設計 最具挑戰的部分是設計獎勵函數,使其最大化時符合多個目標:波浪平滑、能效、安全、駕駛舒適性和符合人類駕駛規範。平衡這些目標需要找到合適的係數。例如,如果燃油消耗最小化主導獎勵,RL AV會學會在高速公路上停車,因為這最節能。為防止此情況,我們引入了動態最小和最大間距閾值,並懲罰AV後方人類車輛的燃油消耗,以抑制自私行為。最終目標是實現節能與合理安全駕駛之間的平衡。

模擬結果 AV學會的行為是保持比人類駕駛員稍大的間距,從而更有效地吸收突發減速。在模擬中,這種方法在擁堵場景下實現了所有道路使用者高達20%的燃油節省,而AV比例不到5%。這些AV不需要特殊車輛,可以是配備智能自適應巡航控制(ACC)的標準乘用車。

100 AV實地測試:大規模部署RL 鑑於模擬結果令人鼓舞,下一步自然是從模擬走向高速公路。我們將訓練好的RL控制器部署在100輛車上,在I-24高速公路高峯時段進行了數天測試。這項名為MegaVanderTest的大規模實驗是有史以來最大的混合自主交通平滑實驗。部署前的步驟包括:在數據驅動模擬中訓練和驗證魯棒性;上傳至硬件,通過車輛自帶巡航控制操作;集成到模塊化控制框架MegaController中,該框架結合了考慮下游交通狀況的速度規劃指導與RL控制器作為最終決策者;在道路上進行硬件驗證,根據人工監督反饋調整控制。

一旦驗證通過,RL控制器便在100輛車上部署,在I-24早高峯時段行駛。周圍交通毫不知情,確保了駕駛員行為無偏。數據通過沿途數十個架空攝像頭採集,經計算機視覺管道提取出數百萬條車輛軌跡。軌跡指標顯示AV周圍燃油消耗呈下降趨勢,與模擬結果一致。例如,緊跟AV後方的人類駕駛員平均燃油消耗更低。通過測量速度和加速度的方差,我們也觀察到波浪幅度降低。總體而言,儘管從大量視頻數據中獲取精確測量複雜,但我們觀察到受控車輛周圍有15-20%的節能趨勢。

最終思考 這次100車實地操作測試是去中心化的,沒有AV間的顯式合作或通信,反映了當前自動駕駛部署現狀,使我們向更平滑、更節能的高速公路邁進了一步。然而,仍有巨大改進潛力。加速更準確的人類駕駛模型模擬對於縮小模擬與現實差距至關重要。為AV配備額外交通數據(通過先進傳感器或集中規劃)可進一步提升性能。例如,多智能體RL有望改進合作控制策略,但啓用AV間通過5G網絡顯式通信能否進一步提高穩定性和緩解走走停停波浪仍是開放問題。關鍵的是,我們的控制器與現有ACC系統無縫集成,使大規模實地部署成為可能。配備智能交通平滑控制的車輛越多,道路上波浪越少,意味着更少的污染和所有人的燃油節省!

許多貢獻者參與了MegaVanderTest的實施,完整名單可在CIRCLES項目頁面獲取。

展開要點與分析

文章情報

工程師進階

要點

  • 使用100輛RL控制的車輛在I-24高速公路進行大規模實地測試,旨在平滑“走走停停”的波浪。
  • RL控制器僅依靠車載雷達和自身速度等本地傳感器信息,實現去中心化操作。
  • 在模擬中,不到5%的AV比例即可帶來高達20%的燃油節省;實地測試觀察到了15-20%的節能趨勢。
  • 控制器與現有自適應巡航控制系統(ACC)無縫集成,便於大規模部署。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。