無需真實世界數據:通過合成視頻場景學習多樣化的人形機器人任務
研究人員提出一種新框架,利用生成式AI將文本提示轉換為逼真多樣的人體運動序列,使人形機器人無需真實數據即可學習多種任務執行風格。在四個仿真場景中,機器人成功完成任務並展現出對複雜運動變化的強適應性。
人形機器人因其類人形態而擁有敏捷和多功能運動的巨大潛力,但複雜技能的獲取成為主要瓶頸。傳統的從演示中學習(Learning-from-Demonstrations)方法高度依賴真實世界數據,然而收集這些數據成本高昂,且難以捕捉特定動作的行為模式,同時不同個體提供的演示往往缺乏多樣性。更為複雜的是,即便對於同一任務,人類也可能採用多種截然不同的運動策略。為此,研究人員提出了一種基於生成式AI的新框架,旨在從根本上解決數據稀缺與多樣性不足的問題。該框架通過將自然語言文本提示(例如“拿起杯子”或“走路繞過障礙物”)輸入至生成模型,模型輸出逼真且多樣的人體運動序列,這些序列以視頻形式呈現,涵蓋同一任務的不同執行風格。機器人通過觀察這些合成演示,學習任務的目標和運動策略,從而獲得廣泛的技能庫,無需任何真實演示或人類干預。研究團隊在四個仿真環境中測試了該方法的有效性,這些環境設計了不同的難度和運動複雜度。結果顯示,機器人不僅在標準任務上表現優異,更展示出對複雜運動變化(如物體位置偏移、環境干擾等)的強適應性,成功泛化到未見過的情況。這項研究已被2026年IEEE/ASME先進智能機電一體化國際會議(AIM)接收,標誌着人形機器人學習領域的重要進展。該框架不僅降低了數據獲取成本,還提高了學習多樣性和魯棒性,為未來人形機器人在服務、工業和探索等領域的廣泛應用鋪平了道路。研究者計劃進一步在真實平台上測試,並探索與強化學習等技術的結合。