多步信念空間動力學學習實現風險感知控制
本文提出一種學習框架,用於預測分佈動力學,並實時優化模型預測控制(MPC),以縮小自動駕駛與人類駕駛之間的差距。通過對真實越野駕駛數據集進行消融研究,並在全尺寸車輛上部署,實現了基於環境自然調節車速的智能行為。
隨着自動駕駛汽車從簡化的研究環境邁向實際應用,人類駕駛與自動駕駛系統之間的動態行為差距日益凸顯。人類駕駛員能夠憑藉直覺和經驗在複雜環境中做出風險感知決策,而傳統自動駕駛系統往往過於保守或不夠穩健。為了實現大規模部署,風險感知行為必須自然形成,而其中的關鍵挑戰在於如何準確預測動態不確定性隨時間的變化,並制定出既充分考慮到這些不確定性、又避免過度保守的規劃方案。
針對這一挑戰,本研究提出了一種新穎的學習框架,用於預測分佈動力學,該框架可直接應用於模型預測控制(MPC)的實時優化。作者深入探討了在為MPC學習分佈動力學時結構的重要性,並指出合理的結構化設計能夠顯著提升預測的準確性和規劃的性能。為了驗證這一觀點,研究團隊在大規模真實越野駕駛數據集上進行了嚴格的消融研究,系統地對比了偏離所提出結構後的性能變化,結果充分證明了所提結構的有效性和必要性。
此外,研究團隊將學習到的模型和完整的規劃堆棧部署在一輛全尺寸車輛上,在極具挑戰性的越野環境中進行了實地測試。測試結果表明,該規劃架構能夠根據環境條件自然地調節車輛速度,在數英里複雜多變的地形上持續展現出智能、穩健的駕駛行為。這一工作為風險感知自動駕駛的實現提供了切實可行的解決方案,推動了從理論研究到實際應用的轉化。