混合專家視覺語言動作模型中湧現的組合技能
該研究探索了利用混合專家(MoE)架構的視覺語言動作模型(VLA)從專家演示中端到端學習組合機器人策略,無需預設任務分解。實驗表明,MoE專家在不同任務中高度複用,對應不同低級行為,路由器隱式學習高級序列規劃,專家作為組合原語,在保持任務性能的同時實現可解釋的模塊化策略。
來源arXiv Robotics作者: Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss, Chirayu Nimonkar, Ishaan Javali
研究人員提出了一種基於混合專家(Mixture-of-Experts, MoE)架構的視覺語言動作模型(VLA),旨在從專家演示中端到端學習組合機器人策略。傳統方法通常需要預定義的任務分解或層次結構,而該研究探索了MoE結構能否自發地讓模型學會將複雜任務分解為可複用、可解釋的原始行為。該研究由Shlok Shah等五位作者完成,論文已被ICML 2026第二屆組合學習研討會接收。
實驗中,研究人員使用了簡化的MoE動作頭,訓練VLA模型執行多種機器人操作任務,包括抓取、放置、堆疊等。他們觀察到,訓練後的MoE專家在不同任務中被高度複用,並且一致地對應於定性上不同的低級行為。例如,某些專家專門處理與物體接觸相關的動作,而另一些則專注於運動軌跡的規劃。這意味着路由器(router)隱式地學會了執行高級序列規劃,而專家單元則充當了組合性原語。這種機制使得模型在不犧牲性能的前提下,具備了模塊化和可解釋性。
具體而言,MoE模型在任務性能上與單一基線模型相當,甚至在某些任務上略優,同時展現出了有意義的專家特化。這是向完全從數據中湧現的模塊化、可解釋機器人策略邁出的重要一步。該方法的優勢在於無需人工標註任務結構,模型能夠自主發現行為基元,有望提升機器人學習的泛化能力和可解釋性。未來,這一方向可能推動更靈活、更透明的機器人控制系統的發展。此外,該研究還探討了專家數量、激活函數等超參數對性能的影響,為後續研究提供了參考。