AI News HubLIVE
站內改寫1 分鐘閱讀

用於演示周圍自適應探索的遍歷模仿方法

針對機器人模仿學習中訓練與部署條件不匹配導致任務失敗的問題,提出一種自適應遍歷模仿方法。該方法從演示幾何構造目標分佈,生成在跟蹤與探索之間自適應插值的軌跡,將遍歷控制擴充套件到檢索遞推控制框架的自適應模仿。

來源arXiv Robotics作者: Ziyi Xu, Cem Bilaloglu, Yiming Li, Sylvain Calinon

在機器人學中,模仿學習的一個常見挑戰是訓練條件與部署條件之間的不匹配。例如,環境變化或觀測與控制的不完善可能導致機器人按照名義軌跡操作時陷入困境,無法完成任務。這要求開發自適應的線上探索策略,同時保持與演示資料的一致性。針對這一問題,Ziyi Xu等人在2026年5月13日提交的論文(arXiv:2605.13996)中提出了一種自適應遍歷模仿方法。

該方法的核心是從檢索到的演示資料的幾何結構構建目標分佈,並利用該分佈生成軌跡,這些軌跡在跟蹤和探索之間自適應地插值。具體來說,當機器人面臨訓練時未見過的情形時,軌跡會從嚴格跟蹤演示向主動探索環境區域平滑過渡,從而避免因條件變化導致的失敗。這項工作將遍歷控制從傳統的區域覆蓋和搜尋任務擴充套件到自適應模仿領域。

研究者將演示資料整合到一個基於檢索的遞推控制框架中。該框架在每個時間步檢索最相關的演示,並基於當前狀態動態調整目標分佈,使機器人在保持整體任務目標的同時靈活響應即時變化。論文篇幅為4頁,包含3張圖表,屬於機器人學(cs.RO)領域。

這一方法的意義在於,它提供了一種系統性的方式來解決模仿學習中的泛化問題。相比於傳統的基於固定軌跡的模仿方法,自適應遍歷模仿允許機器人根據實際情況線上調整行為,而無需重新訓練。未來的工作可能包括在真實機器人平臺上驗證該方法,以及探索更高效的檢索策略。