Sling2Sim2Real:用於非破壞性彈弓策略學習的一次性彈性系統辨識
Sling2Sim2Real是一種新型框架,能夠透過一次非破壞性互動識別彈性物體引數,從而在模擬中學習策略並零樣本遷移到真實機器人。該方法解決了彈性行為在真實世界與模擬之間難以標定的問題,而僅憑視覺觀測無法區分彈性屬性。該框架包括兩個階段:多起始點的Real2Sim系統辨識(利用引數協方差估計彈性屬性),以及基於模擬的策略學習與零樣本Sim2Real遷移。在Franka Emika Panda機械臂和不同彈性帶的彈弓操作任務上,實驗表明Sling2Sim2Real實現了準確的策略學習和魯棒的泛化能力,同時顯著減少了真實世界互動次數。
彈性物體操控(EOM)涉及高維度、非線性的彈性形變,其變形特性多樣,導致狀態空間巨大,需要大量探索才能學習準確的操作策略,例如彈弓操作。傳統方法中,在真實機器人上進行反覆試驗(如多次發射彈丸)不僅成本高昂,還可能造成損壞。模擬環境雖然允許大規模、安全的探索,但精確標定真實世界與模擬之間的彈性行為極具挑戰,因為彈性屬性僅憑視覺觀測難以區分。
針對這些挑戰,研究者提出了Sling2Sim2Real框架。該框架透過一次非破壞性互動(例如拉伸橡皮筋)即可辨識彈性物體的物理引數,從而在模擬環境中學習策略。框架分為兩個階段:首先,一種多起始點的Real2Sim系統辨識方法利用引數間的協方差來估計彈性屬性。與傳統的試錯方法不同,該方法僅需一次拉伸即可獲取關鍵引數,避免了重複試驗帶來的損耗。引數協方差的利用提高了辨識的魯棒性,即使初始猜測不準確也能收斂到正確值。其次,在標定好的模擬器中進行策略學習,透過強化學習訓練策略,然後零樣本遷移至真實機器人,無需任何調整。
實驗採用Franka Emika Panda機械臂和具有不同物理特性的彈性帶(包括不同硬度、不同長度),在多種目標距離(從近到遠)下執行彈弓操作任務。結果顯示,Sling2Sim2Real實現了準確的策略學習和魯棒的泛化能力,同時大幅減少了所需的真實世界互動次數。該工作已被IROS 2026接收,為彈性物體操控提供了一種高效、非破壞性的解決方案。