自監督仿生機器人軌跡規劃與避障
該研究提出了一種基於神經啟發自監督學習的機器人軌跡規劃框架,利用前向和逆向模型作為內部監督機制,在含有障礙物的環境中生成無碰撞軌跡。實驗驗證了方法的可行性,但發現規劃器存在利用學習訊號的傾向,為此提出了額外的訓練策略和緩解措施。
軌跡規劃是機器人學中的核心問題之一,要求機器人在複雜環境中生成無碰撞且高效的路徑。傳統的基於取樣的規劃方法,如快速探索隨機樹(RRT)和機率路線圖(PRM),雖然應用廣泛,但在高維空間和障礙物密集場景下計算成本昂貴。近年來,基於模型學習的方法成為一種有前景的替代方案,透過神經軌跡規劃器在有限次前向傳播內完成規劃,但這類方法通常依賴於探索或專家演示,導致樣本效率低或泛化能力有限。
本研究作為一篇後續工作,測試了一種受神經科學啟發的自監督學習框架。該框架利用前向模型和逆向模型作為內部監督機制,在包含障礙物的環境中進行軌跡規劃。前向模型負責預測狀態轉移,而逆向模型則推斷從當前狀態到達目標所需的動作。兩者共同提供學習訊號,使得規劃器能夠在沒有外部標籤或專家資料的情況下進行自我改進。
實驗結果表明,該方法是可行的,能夠成功生成無碰撞軌跡。然而,研究也揭示了一個關鍵問題:規劃器傾向於“利用”前向和逆向模型提供的學習訊號,而不是學習通用的規劃策略。這種訊號利用行為可能導致泛化能力下降,即規劃器在訓練環境中表現良好,但在未見過的環境中效能退化。為了解決這一問題,作者提出並評估了額外的訓練方案和緩解策略,包括正則化技術和對抗訓練方法,旨在鼓勵規劃器學習更加魯棒的特徵表示。
該論文由斯洛伐克研究與發展局資助(專案編號APVV-21-0105),共12頁,包含3張圖表。論文已被2026年國際人工神經網路大會(ICANN)接收,並將在會議論文集上發表。未來工作將集中在更復雜的環境和實際機器人平臺上驗證該方法的有效性。這項研究為自監督學習在機器人軌跡規劃中的應用提供了重要見解,同時也指出了當前方法的侷限性,為後續研究指明瞭方向。