REFACTOR-VLA:無監督的帶型別運動程式庫學習
蘋果機器學習研究團隊提出 REFACTOR-VLA,透過“清醒/睡眠”架構讓視覺-語言-動作模型無監督學習可複用的帶型別運動程式。睡眠階段用行為等價核在潛在世界模型中聚類動作片段,清醒階段生成 Hindley–Milner 風格的帶型別 lambda 項,並經最小描述長度與回報保持門檻篩選形成技能庫。完整 LIBERO 實驗顯示,將世界模型從 1.88 億擴到 4.3 億引數反而使 4 個套件效能全部下降;在階段 A 加入 InfoNCE 輔助損失後,階段 C 的技能聚類質量顯著提高,NMI 最高達 0.915。
蘋果機器學習研究團隊近期發表論文《REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs》,提出一種讓視覺-語言-動作(VLA)模型無監督學習可複用“帶型別運動程式”的方法。該論文作者為 Riyaaz Shaik 與 Chandru Venkataraman,2026 年 9 月公開。
當前主流 VLA 模型(如 OpenVLA、π0、RT-2 和 RDT-1B)大多屬於“單體式”架構,網路直接輸出原始馬達指令或極短的動作片段,而不把行為組織成有清晰邊界的可複用模組。研究指出,這類模型在長期、多步驟任務上表現不佳,也難以解釋學到什麼。以往技能發現工作常回避一個關鍵判定:兩條動作序列何時“行為等價”。AtomicVLA、AtomSkill 透過給對比嵌入聚類來分組,BLADE、LRLL 則依賴 LLM 判斷,但 LLM 並未針對機器人的真實動力學進行校準。
REFACTOR-VLA 使用“清醒/睡眠”(wake/sleep)兩階段結構。睡眠階段利用行為等價核(BEK),把動作片段在已學到的潛在世界模型 Mφ 中滾動執行,依據結果是否一致來進行聚類;清醒階段從一個受 Hindley–Milner 型別系統啟發的詞彙表生成帶型別 lambda 項,這些簡單、結構化的程式再交給“以技能庫為條件的整流流動作解碼器”生成實際動作。候選抽象若要透過驗收,必須同時滿足最小描述長度(MDL)準則與回報保持門檻,才會被加入技能庫。
訓練採用三階段計劃:階段 A 預熱潛在世界模型 Mφ;階段 B 最佳化使用技能庫的策略;階段 C 進入睡眠階段,把動作片段聚成可複用技能。團隊在完整 LIBERO 基準套件上評估,得到兩個主要結論。第一,將世界模型引數量從 1.88 億增至 4.3 億,反而導致 4 個任務套件的效能全部下降,顯示“世界模型越大越好”並非普遍成立。第二,訓練目標的選擇影響顯著:在階段 A 加入輔助監督對比損失 InfoNCE 後,階段 C 的技能聚類質量大幅提升。在 n=3 的多隨機種子評測下,歸一化互資訊(NMI)得分為:Object 套件 0.462 ± 0.021,Spatial 套件 0.867 ± 0.025,Goal 套件 0.915 ± 0.013,LIBERO-10 套件 0.754 ± 0.010。