AI News HubLIVE
サイト内リライト2 分で読了

混合専門家VLAにおける創発的な構成スキル

本研究は、Mixture-of-Experts(MoE)アクションヘッドを用いたVLAが、事前定義されたタスク分解なしに専門家デモからロボットポリシーをエンドツーエンドで学習できるかを探る。学習された専門家はタスク間で再利用され、質的に異なる低レベル行動に対応し、ルーターが暗に高レベルのシーケンス実行を学習する。MoEは単一ベースラインと同等の性能を達成しつつ、解釈可能な専門化を示す。

ソースarXiv Robotics著者: Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss, Chirayu Nimonkar, Ishaan Javali

研究者らは、混合専門家(Mixture-of-Experts, MoE)アーキテクチャを備えた視覚言語動作モデル(VLA)を提案し、専門家のデモンストレーションからエンドツーエンドでロボットポリシーを学習する問題に取り組んだ。従来の手法ではタスク分解や階層構造を事前に定義する必要があるが、本研究ではMoE構造によってモデルが複雑なタスクを再利用可能で解釈可能なプリミティブに自律的に分解する能力を獲得できるかを検証した。本研究成果はICML 2026の第2回構成学習ワークショップで採択された。

実験では、簡略化されたMoEアクションヘッドを使用してVLAモデルを訓練し、把持、配置、積み上げなど複数のロボット操作タスクを実行させた。その結果、学習された専門家は異なるタスク間で高度に再利用され、質的に異なる低レベル行動に一貫して対応することが明らかになった。例えば、ある専門家は物体との接触に関連する動作を専門とし、別の専門家は軌道計画に特化していた。これはルーターが暗に高レベルのシーケンス計画を実行し、専門家が構成プリミティブとして機能していることを示唆する。このメカニズムにより、MoEモデルは性能を犠牲にすることなく、モジュール性と解釈可能性を実現している。

具体的には、MoEモデルは単一のベースラインモデルと同等またはそれ以上のタスク性能を達成しながら、意味のある専門家の特化を示した。これは、データのみから創発するモジュール型で解釈可能なロボットポリシーへの重要な一歩である。本手法の利点は、人手によるタスク構造のアノテーションを必要とせず、モデルが自律的に行動プリミティブを発見できる点にある。これにより、ロボット学習の汎化能力と解釈可能性の向上が期待される。将来的には、より柔軟で透明性の高いロボット制御システムの開発につながる可能性がある。また、専門家の数や活性化関数などのハイパーパラメータが性能に与える影響についても検討されており、今後の研究の基盤を提供している。