AI News HubLIVE
站內改寫2 分鐘閱讀

DiDrive:面向安全自動駕駛離線強化學習的風險感知分層擴散框架

DiDrive提出了一種分佈引導的離線擴散框架,結合風險感知分層擴散(RHDif)架構與3DICE策略最佳化正規化,用於緩解自動駕駛離線強化學習中的分佈偏移、重尾風險、分佈外動作生成和高維狀態冗餘。在CARLA基準高密度交通場景中,DiDrive相比IQL、CQL和Diffusion-QL等基線方法取得更優效能,達到85%成功率和4295.68平均獎勵。

來源arXiv Machine Learning作者: Qisong Guo, Jingtang Chen, Zhilin Chen, Pei Xu, Mingjian Fu, Wenxi Liu, Yuanlong Yu

擴散模型近年來在自動駕駛領域受到廣泛關注,因為它們能夠捕捉多模態的行為先驗,為複雜交通環境下的決策提供豐富的表達能力。然而,將擴散模型與離線強化學習(RL)相結合後,策略仍然面臨多項挑戰:分佈偏移(distribution shift)導致模型在遇到與訓練資料分佈不一致的輸入時表現不佳;重尾風險(heavy-tailed risk)使得偶發的極端事件難以被充分建模;分佈外(OOD)動作生成可能引發安全隱患;此外,高維狀態空間中的大量冗餘資訊也會干擾模型的判斷。為了系統性地解決這些問題,Qisong Guo等六位研究者提出了一種名為DiDrive的分佈引導離線擴散框架。

DiDrive由兩個協同工作的元件構成。第一個元件是風險感知分層擴散(RHDif)架構,它在狀態空間層面進行操作。RHDif由一個低層風險門控編碼器和一個高層上下文調變器組成,前者負責篩選環境中的冗餘資訊,突出與安全性密切相關的威脅訊號,後者則將上下文資訊進行調變,使模型能夠把注意力集中在關鍵的安全風險上。第二個元件是3DICE策略最佳化正規化,它在動作空間層面發揮作用。3DICE透過樣本內校準的引導、時空最佳化以及基於整合的候選排序機制,有效抑制了分佈外動作的過估計問題,並緩解了訓練過程中可能出現的梯度振盪,從而增強了策略的魯棒性。

研究團隊在CARLA模擬平臺上進行了大量評估實驗。實驗結果顯示,DiDrive在整體效能上優於IQL、CQL和Diffusion-QL等現有基線方法。尤其值得一提的是,在包含60輛車輛的高密度複雜交通場景中,DiDrive取得了85%的成功率和4295.68的平均獎勵,相比其他方法有了顯著提升。這些結果驗證了DiDrive在處理高密度交通流和複雜道路情況時的有效性,也表明該框架具備為安全自動駕駛決策提供可靠支援的能力。

論文於2026年6月4日提交至arXiv,編號為2609.01609v1,全文共16頁。值得注意的是,該研究歸屬於機器學習(cs.LG)與機器人學(cs.RO)兩個交叉領域,並已透過arXiv平臺獲得數字物件識別符號(DOI):10.48550/arXiv.2609.01609。除了PDF版本外,作者還提供了實驗性的HTML頁面和TeX原始碼,方便研究社群復現和進一步探索。該方法的創新之處在於將風險感知機制引入分層擴散架構,同時在動作空間中採用多種正則化手段,形成了一個端到端的可訓練系統。與以往將擴散模型僅作為策略表示的工作不同,DiDrive在狀態空間和動作空間都設計了針對性的約束,使模型不僅能夠擬合資料分佈,還能主動規避潛在的風險區域。這種設計尤其適用於現實中資料分佈不均、極端場景稀少的自動駕駛環境。儘管目前實驗侷限於模擬環境,該框架為後續在真實車隊資料上的驗證以及跨環境的泛化研究奠定了基礎。總體而言,DiDrive為離線強化學習與擴散模型的結合提供了一條新的思路,特別是在安全性要求極高的自動駕駛領域,這一框架的提出具有重要的理論意義和實際應用潛力。