因果影片模型是資料高效的機器人策略學習者
Rhoda AI 提出直接影片-動作模型(DVA),將機器人控制重新定義為影片生成,利用網路影片預訓練實現資料高效的任務學習、長期上下文記憶、一次性學習和可解釋性。該模型透過因果影片模型和逆動力學模型,在僅需約10小時機器人資料的情況下完成複雜任務,並支援從單一演示中上下文學習。
Rhoda AI 的研究人員提出了直接影片-動作模型(Direct Video-Action Model, DVA),這是一種全新的機器人控制正規化,將機器人策略重新定義為影片生成問題。該模型利用大規模網路影片進行預訓練,從而賦予機器人豐富的物理世界知識,使其能夠以極少的機器人專用資料高效學習新任務。
與傳統的視覺-語言-動作模型不同,DVA 透過因果影片模型直接預測未來幀,再使用小型逆動力學模型將預測的影片轉換為機器人動作。這種設計使得模型天然具備長上下文視覺記憶,能夠處理數百幀的視覺資訊,從而協調複雜的端到端多步驟任務。此外,長上下文還解鎖了一次性學習能力:機器人可以在測試時從單個人類演示中上下文模仿行為。
為了高效訓練因果影片模型,研究人員引入了“上下文攤銷”策略。該策略在訓練時對長序列中的每個時間點都進行未來幀預測,類似於語言模型中的下一個token預測。這使得模型能夠同時在數百幀的上下文中進行訓練,大大提高了訓練效率。同時,KV快取技術在推理時重複利用編碼的上下文,減少了計算冗餘。
逆動力學模型是DVA的另一個關鍵組成部分。它負責將生成的影片翻譯為具體的末端執行器動作。由於影片生成已經處理了複雜的決策部分,逆動力學成為一個更加約束的問題,僅需約10小時的本體型別資料即可訓練。值得注意的是,這些資料甚至不需要高質量的任務演示,隨機運動也足以訓練逆動力學模型。
為了實現即時閉環控制,研究人員設計了“蛙跳推理”策略:模型一次預測足夠長的未來幀,以覆蓋下一次推理的延遲,同時透過條件化當前執行的動作來確保軌跡連續性。該策略保證了機器人在物理世界中的即時響應。
總之,DVA 模型透過將機器人控制簡化為影片生成,實現了資料高效、可解釋、可擴充套件的機器人學習。由於影片資料在網路上的規模遠大於機器人互動資料集,該方法為通用機器人技術提供了清晰的規模化路徑。