3D RL-DWA:一種用於多自由度機器人目標導向局部導航的混合強化學習與動態窗口方法
本研究提出了一種結合強化學習(RL)與動態窗口方法(DWA)的混合框架,用於高自由度機器人系統的自適應3D局部導航。該方法利用稀疏點雲數據動態調整可變形微型機器人的運動和形狀,使其能夠在複雜受限環境中向目標導航,同時最大化佔據體積。在模擬血管網絡中的1080次試驗表明,與純RL和基於模型的方法相比,混合方法顯著提升了變形和導航能力。訓練後的控制器在未知場景中仍保持穩健性能,凸顯了混合規劃策略在稀疏感知條件下高效自適應3D導航的潛力。
一篇名為“3D RL-DWA: A Hybrid Reinforcement Learning and Dynamic Window Approach for Goal-Directed Local Navigation in Multi-DoF Robots”的論文於2026年5月12日提交至arXiv,並被IEEE/ASME國際先進智能機電一體化會議(AIM2026)接收。該研究由Chiara Castellani等人共同完成,提出了一種創新性的混合導航方法,旨在解決高自由度(DoF)機器人系統在三維空間中的複雜局部導航問題。
傳統導航方法通常依賴強化學習(RL)或動態窗口方法(DWA)中的一種,但各有侷限。RL在處理動態環境時可能收斂緩慢,而DWA對全局規劃依賴較強。該研究巧妙地整合了兩者的優勢:利用RL智能體的決策能力與DWA的實時避障功能,使系統能夠根據稀疏點雲數據同時調整微型機器人的運動軌跡和自身形狀。這種可變形能力使其在類似血管網絡的狹窄、複雜環境中既能高效向目標移動,又能最大化佔據空間,從而提升通過性。
研究人員在模擬血管網絡中進行了大量實驗,總計1080次試驗。結果顯示,RL-DWA混合方法在變形能力和導航路徑完成率上顯著優於純RL方法和傳統基於模型的方法。特別地,在訓練階段,混合控制器能夠持續保持高水平變形,並幾乎完美地完成預設路徑。更關鍵的是,在面對未經訓練的全新場景時,該控制器仍能維持穩健性能,展現出出色的泛化能力。這些成果表明,混合規劃策略在稀疏感知條件下實現高效、自適應3D導航具有巨大潛力,尤其適用於醫療微創手術、災難搜救等領域的微型機器人控制。
論文還提供了完整的代碼、數據和實驗細節,便於其他研究者復現和擴展。該研究為高自由度機器人導航領域提供了一種新思路,未來或可進一步結合視覺傳感器或動態障礙物預測,以提升在真實世界中的適用性。此外,該混合框架的模塊化設計允許靈活替換或升級RL和DWA組件,為後續優化提供了便利。