AI News HubLIVE
站內改寫1 分鐘閱讀

REFACTOR-VLA:無監督的帶類型運動程序庫學習

蘋果機器學習研究團隊提出 REFACTOR-VLA,通過“清醒/睡眠”架構讓視覺-語言-動作模型無監督學習可複用的帶類型運動程序。睡眠階段用行為等價核在潛在世界模型中聚類動作片段,清醒階段生成 Hindley–Milner 風格的帶類型 lambda 項,並經最小描述長度與回報保持門檻篩選形成技能庫。完整 LIBERO 實驗顯示,將世界模型從 1.88 億擴到 4.3 億參數反而使 4 個套件性能全部下降;在階段 A 加入 InfoNCE 輔助損失後,階段 C 的技能聚類質量顯著提高,NMI 最高達 0.915。

蘋果機器學習研究團隊近期發表論文《REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs》,提出一種讓視覺-語言-動作(VLA)模型無監督學習可複用“帶類型運動程序”的方法。該論文作者為 Riyaaz Shaik 與 Chandru Venkataraman,2026 年 9 月公開。

當前主流 VLA 模型(如 OpenVLA、π0、RT-2 和 RDT-1B)大多屬於“單體式”架構,網絡直接輸出原始馬達指令或極短的動作片段,而不把行為組織成有清晰邊界的可複用模塊。研究指出,這類模型在長期、多步驟任務上表現不佳,也難以解釋學到什麼。以往技能發現工作常回避一個關鍵判定:兩條動作序列何時“行為等價”。AtomicVLA、AtomSkill 通過給對比嵌入聚類來分組,BLADE、LRLL 則依賴 LLM 判斷,但 LLM 並未針對機器人的真實動力學進行校準。

REFACTOR-VLA 使用“清醒/睡眠”(wake/sleep)兩階段結構。睡眠階段利用行為等價核(BEK),把動作片段在已學到的潛在世界模型 Mφ 中滾動執行,依據結果是否一致來進行聚類;清醒階段從一個受 Hindley–Milner 類型系統啓發的詞彙表生成帶類型 lambda 項,這些簡單、結構化的程序再交給“以技能庫為條件的整流流動作解碼器”生成實際動作。候選抽象若要通過驗收,必須同時滿足最小描述長度(MDL)準則與回報保持門檻,才會被加入技能庫。

訓練採用三階段計劃:階段 A 預熱潛在世界模型 Mφ;階段 B 優化使用技能庫的策略;階段 C 進入睡眠階段,把動作片段聚成可複用技能。團隊在完整 LIBERO 基準套件上評估,得到兩個主要結論。第一,將世界模型參數量從 1.88 億增至 4.3 億,反而導致 4 個任務套件的性能全部下降,顯示“世界模型越大越好”並非普遍成立。第二,訓練目標的選擇影響顯著:在階段 A 加入輔助監督對比損失 InfoNCE 後,階段 C 的技能聚類質量大幅提升。在 n=3 的多隨機種子評測下,歸一化互信息(NMI)得分為:Object 套件 0.462 ± 0.021,Spatial 套件 0.867 ± 0.025,Goal 套件 0.915 ± 0.013,LIBERO-10 套件 0.754 ± 0.010。