MoMo:利用時空動作標記化實現機器人操作中的運動模式調節
本文介紹了MoMo,一種兩階段模仿學習框架,透過時空動作標記化和行為克隆變換器,使機器人能夠在不同任務中調節運動模式(平穩、動態、中間),從而實現執行層面的變化。在六項真實機器人操作任務中,該方法展現出對未見任務-模式組合的組合泛化能力。
近日,來自麻省理工學院等機構的研究人員提出了一種名為MoMo的機器人操作框架,該框架透過時空動作標記化技術,讓機器人能夠根據任務需求靈活調整其操作風格,例如平穩、動態或介於兩者之間的模式。這一工作以論文形式發表在arXiv預印本上,編號為2607.26315,作者包括Yuhan Hu等六位研究人員。
MoMo框架的核心是一個兩階段的模仿學習流程。第一階段是時空動作標記器(Spatiotemporal Action Tokenizer),它將機器人連續的動作序列分解為離散的時空標記,從而捕捉動作的區域性和全域性特徵。第二階段是一個行為克隆變換器(Behavior-Cloning Transformer),它以任務描述和一個連續的運動模式條件作為輸入,輸出對應的動作序列。這個運動模式條件就像一個旋鈕,可以連續調節,讓機器人在執行任務時展現出不同的運動風格,從非常平穩到非常動態,以及中間的各種過渡狀態。
研究團隊在六種真實的機器人操作任務上進行了實驗,這些任務包括推、抓取、放置等典型的操作技能。透過在訓練時提供不同模式下的演示資料,機器人學會了如何根據給定的模式條件調整其運動。實驗結果顯示,人類評估者能夠清晰地區分出平穩、動態和中間模式下的機器人行為,這些行為在關節速度、加速度以及末端執行器的接近角度上都有顯著差異。例如,動態模式下的機器人動作更快、加速度更大,而平穩模式則更緩慢且軌跡更平滑。
更重要的是,MoMo展現出了強大的組合泛化能力。即使某些任務只在一個運動模式下被演示過,機器人也能成功地將未見過的模式遷移到這些任務中,同時保持較高的任務成功率。這意味著運動模式可以作為一種跨任務複用的行為因子,讓機器人能夠以不同的方式執行同一操作技能,而無需為每種模式單獨收集大量的演示資料。這一發現對於減少資料收整合本和提高機器人的適應性具有重要意義。
這項研究為機器人操作中的執行層面變化提供了新的解決思路,使機器人能夠更加靈活地適應不同的操作環境和要求。未來,研究團隊計劃將MoMo擴充套件到更復雜的任務和更廣泛的機器人平臺上,並探索自動選擇最優運動模式的方法。該工作得到了相關領域的關注,可能對後續的機器人學習、控制和人機互動研究產生積極影響。