AI News HubLIVE
站內改寫1 分鐘閱讀

SCAR:自監督連續動作表示學習

SCAR提出一種自監督框架,透過聯合逆正向動力學從視覺轉換中學習跨具身的統一動作表示,利用生成式骨幹網路、逆動力學模型和正向動力學模型,並採用高斯先驗正則化和對抗不變性來提升可遷移性。實驗表明,該動作表示比具身特定原始動作更有效,增強了跨具身低資料適應和跨任務遷移。

來源arXiv Robotics作者: Hongjia Liu, Fan Feng, Minghao Fu, Xinyue Wang, Haofei Lu, Biwei Huang

來自香港大學等機構的研究人員提出了一種名為SCAR(Self-Supervised Continuous Action Representation Learning,自監督連續動作表示學習)的新框架,旨在解決具身智慧中動作表示的可遷移性挑戰。該論文於2026年5月13日提交至arXiv(編號2605.16412),展示瞭如何從視覺轉換中學習統一的動作表示,從而讓世界模型能夠在不同物理形態之間泛化,尤其在資料有限的情況下表現出色。

傳統的世界模型通常將動作視為輔助條件訊號,但SCAR將動作視為獨立的表示因子,能夠將可控變化與具身特定的驅動方式分離開來。該框架構建在預訓練的生成式骨幹網路上,核心包含兩個模組:逆動力學模型(IDM)從潛在觀測對中推斷潛在動作,正向動力學模型(FDM)基於這些潛在動作預測未來的動態變化。

為了確保潛在空間具有可遷移性,而非淪為通用的視覺瓶頸,SCAR引入了兩種正則化技術。首先,透過將潛在動作的後驗分佈向標準高斯先驗對齊,限制任意視覺編碼。其次,引入對抗不變性機制,抑制具身和環境帶來的干擾因素。這種設計使得SCAR學習的動作表示能夠捕捉不同物理形態之間共享的“可控變化”本質。

在Procgen和Robotwin資料集上的實驗驗證了該方法的有效性。Procgen包含多種遊戲環境,用於測試跨任務遷移;Robotwin則專注於機器人操控場景。結果顯示,與使用具身特定原始動作相比,SCAR學習的統一潛在動作表示作為世界模型的條件介面更為強大,顯著提升了跨具身的低資料適應能力和跨任務遷移效能。例如,在僅有少量演示資料的情況下,SCAR能夠快速適應新的機器人形態。這一成果表明,動作可以作為一種跨具身的共享表示來學習,為構建更具泛化性的世界模型提供了新思路,對未來通用機器人智慧具有重要意義。