混合专家视觉语言动作模型中涌现的组合技能
该研究探索了利用混合专家(MoE)架构的视觉语言动作模型(VLA)从专家演示中端到端学习组合机器人策略,无需预设任务分解。实验表明,MoE专家在不同任务中高度复用,对应不同低级行为,路由器隐式学习高级序列规划,专家作为组合原语,在保持任务性能的同时实现可解释的模块化策略。
来源arXiv Robotics作者: Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss, Chirayu Nimonkar, Ishaan Javali
研究人员提出了一种基于混合专家(Mixture-of-Experts, MoE)架构的视觉语言动作模型(VLA),旨在从专家演示中端到端学习组合机器人策略。传统方法通常需要预定义的任务分解或层次结构,而该研究探索了MoE结构能否自发地让模型学会将复杂任务分解为可复用、可解释的原始行为。该研究由Shlok Shah等五位作者完成,论文已被ICML 2026第二届组合学习研讨会接收。
实验中,研究人员使用了简化的MoE动作头,训练VLA模型执行多种机器人操作任务,包括抓取、放置、堆叠等。他们观察到,训练后的MoE专家在不同任务中被高度复用,并且一致地对应于定性上不同的低级行为。例如,某些专家专门处理与物体接触相关的动作,而另一些则专注于运动轨迹的规划。这意味着路由器(router)隐式地学会了执行高级序列规划,而专家单元则充当了组合性原语。这种机制使得模型在不牺牲性能的前提下,具备了模块化和可解释性。
具体而言,MoE模型在任务性能上与单一基线模型相当,甚至在某些任务上略优,同时展现出了有意义的专家特化。这是向完全从数据中涌现的模块化、可解释机器人策略迈出的重要一步。该方法的优势在于无需人工标注任务结构,模型能够自主发现行为基元,有望提升机器人学习的泛化能力和可解释性。未来,这一方向可能推动更灵活、更透明的机器人控制系统的发展。此外,该研究还探讨了专家数量、激活函数等超参数对性能的影响,为后续研究提供了参考。