AI News HubLIVE
站內改寫1 分鐘閱讀

地形一致的參考引導強化學習實現人形機器人自主導航

本文提出一種訓練人形機器人參考引導感知強化學習運動策略的方法,在訓練中根據地形幾何調整參考軌跡。該方法在強化學習訓練迴圈內合成SE(2)可控參考軌跡,將期望的腳步投影到有效立足點,並調整擺動腳和質心軌跡以適應地形。在模擬中,地形條件參考顯著提升了跟蹤效能。在硬體上,整合MPC+控制障礙函式規劃器,在Unitree G1機器人上實現了超過70米的長距離閉環自主導航,穿越崎嶇地形和連續樓梯,所有感知和計算均在板載完成。

來源arXiv Robotics作者: William D. Compton, Zachary Olkin, Aaron D. Ames

研究人員提出了一種訓練人形機器人參考引導感知強化學習運動策略的新方法,該方法在訓練過程中根據地形幾何調整參考軌跡。該工作旨在將方法部署到標準導航自主基礎設施中,透過在強化學習訓練迴圈內合成SE(2)可控參考軌跡,將期望的腳步投影到有效立足點,並調整擺動腳和質心軌跡以適應地形。最終策略提供了乾淨的SE(2)速度介面,相容標準導航規劃器。在模擬中,與環境無關的參考相比,地形條件參考顯著提升了參考跟蹤效能。在硬體實驗中,研究人員將策略與MPC(模型預測控制)和控制障礙函式規劃器整合,在Unitree G1機器人上演示了長距離(超過70米)閉環自主導航,穿越包含崎嶇地形和連續樓梯的室外環境,所有感知和計算均在板載完成。該論文共有8頁,包含4張圖,擬投稿至Humanoids 2026會議。研究結果表明,這種地形一致的訓練方法能夠有效提升人形機器人在複雜環境中的自主導航能力,為未來在搜救、勘探等領域的應用奠定了基礎。此外,該方法透過合成SE(2)可控參考軌跡,使得機器人能夠根據地形即時調整腳步和重心,從而在凹凸不平的地面和樓梯上保持平衡。MPC與控制障礙函式的結合進一步確保了導航的安全性和魯棒性。所有感知和計算均在機器人板載計算機上完成,無需外部處理,顯示了實際部署的可行性。作者來自相關研究機構,論文已提交至Humanoids 2026,有望推動人形機器人自主導航技術的發展。