MoMo:透過時空動作標記化實現機器人操作中的運動模式調節
機器人需根據任務、物體和互動環境調整操作方式,而不僅限於精確執行。本文提出MoMo,一個兩階段模仿學習框架,包含時空動作標記器和行為克隆Transformer,可輸入連續的運動模式條件。在六個真實機器人操作任務中,改變該條件可產生穩定、動態及中間行為,且人類評估者能夠區分。在僅演示一種模式的任務上,MoMo能轉移未見過的請求模式,同時基本保持任務成功率,展示了任務-模式組合的泛化能力。
機器人要在多樣化的環境中有效工作,不僅需要精確完成操作任務,還要根據具體任務、物體和互動環境調整行為方式。這種執行層面的變化能否被學習並作為可複用的行為因素共享於不同任務之間?蘋果機器學習研究團隊發表的論文《MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization》對此進行了探索。
MoMo是一個兩階段的模仿學習框架。第一階段是時空動作標記器(spatiotemporal action tokenizer),將連續的機器人動作序列離散化為具有時間和空間結構的令牌。第二階段是一個行為克隆Transformer,它以任務指令和連續的運動模式條件作為輸入,輸出相應的動作令牌序列,從而生成符合期望運動模式的操作。
研究團隊在六個真實機器人操作任務上進行了實驗,包括抓取、放置、推拉等。透過調整輸入的運動模式條件,機器人可以表現出穩定(steady)、動態(dynamic)以及介於兩者之間的中間行為。這些行為差異可以透過關節速度、加速度和末端執行器的接近俯仰角等指標量化,並且人類評估者能夠根據操作風格進行區分。
關鍵實驗之一是測試MoMo的跨任務泛化能力。當某個任務僅在單一運動模式下演示(例如只演示穩定模式)時,MoMo能夠成功地將從未見過的運動模式(例如動態模式)應用於該任務,同時基本保持任務成功率。這表明運動模式可以作為獨立於任務的因素進行學習和複用。
該研究證實了運動模式可以作為一種可複用的行為控制因子,在不同操作技能之間遷移,從而提升了機器人行為多樣性和適應性。未來,這種框架有望降低機器人演示資料收整合本,並增強機器人在複雜環境中的靈活性。