AI News HubLIVE
站内改写1 分钟阅读

REFACTOR-VLA:无监督的带类型运动程序库学习

苹果机器学习研究团队提出 REFACTOR-VLA,通过“清醒/睡眠”架构让视觉-语言-动作模型无监督学习可复用的带类型运动程序。睡眠阶段用行为等价核在潜在世界模型中聚类动作片段,清醒阶段生成 Hindley–Milner 风格的带类型 lambda 项,并经最小描述长度与回报保持门槛筛选形成技能库。完整 LIBERO 实验显示,将世界模型从 1.88 亿扩到 4.3 亿参数反而使 4 个套件性能全部下降;在阶段 A 加入 InfoNCE 辅助损失后,阶段 C 的技能聚类质量显著提高,NMI 最高达 0.915。

苹果机器学习研究团队近期发表论文《REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs》,提出一种让视觉-语言-动作(VLA)模型无监督学习可复用“带类型运动程序”的方法。该论文作者为 Riyaaz Shaik 与 Chandru Venkataraman,2026 年 9 月公开。

当前主流 VLA 模型(如 OpenVLA、π0、RT-2 和 RDT-1B)大多属于“单体式”架构,网络直接输出原始马达指令或极短的动作片段,而不把行为组织成有清晰边界的可复用模块。研究指出,这类模型在长期、多步骤任务上表现不佳,也难以解释学到什么。以往技能发现工作常回避一个关键判定:两条动作序列何时“行为等价”。AtomicVLA、AtomSkill 通过给对比嵌入聚类来分组,BLADE、LRLL 则依赖 LLM 判断,但 LLM 并未针对机器人的真实动力学进行校准。

REFACTOR-VLA 使用“清醒/睡眠”(wake/sleep)两阶段结构。睡眠阶段利用行为等价核(BEK),把动作片段在已学到的潜在世界模型 Mφ 中滚动执行,依据结果是否一致来进行聚类;清醒阶段从一个受 Hindley–Milner 类型系统启发的词汇表生成带类型 lambda 项,这些简单、结构化的程序再交给“以技能库为条件的整流流动作解码器”生成实际动作。候选抽象若要通过验收,必须同时满足最小描述长度(MDL)准则与回报保持门槛,才会被加入技能库。

训练采用三阶段计划:阶段 A 预热潜在世界模型 Mφ;阶段 B 优化使用技能库的策略;阶段 C 进入睡眠阶段,把动作片段聚成可复用技能。团队在完整 LIBERO 基准套件上评估,得到两个主要结论。第一,将世界模型参数量从 1.88 亿增至 4.3 亿,反而导致 4 个任务套件的性能全部下降,显示“世界模型越大越好”并非普遍成立。第二,训练目标的选择影响显著:在阶段 A 加入辅助监督对比损失 InfoNCE 后,阶段 C 的技能聚类质量大幅提升。在 n=3 的多随机种子评测下,归一化互信息(NMI)得分为:Object 套件 0.462 ± 0.021,Spatial 套件 0.867 ± 0.025,Goal 套件 0.915 ± 0.013,LIBERO-10 套件 0.754 ± 0.010。