EMO:事前学習による混合エキスパートの創発的モジュール性
2026年5月8日、アレン人工知能研究所(Ai2)は、新しい混合エキスパート(MoE)モデル「EMO」を発表しました。EMOはエンドツーエンドの事前学習を通じて、人間が定義した事前知識に頼ることなく、モジュール構造がデータから直接現れるように設計されています。
大規模言語モデルは通常、単一の統合システムとして訓練・デプロイされますが、アプリケーションによってはコード生成や数学的推論など、特定の能力のみが必要な場合があります。パラメータ数が兆単位に達する中、全モデルを使い続けるのは非効率です。MoEモデルは各層に多数の小さなエキスパートを持ち、入力トークンごとに一部のみを活性化することでこの問題を緩和しようとしますが、既存のMoEではタスク実行中に結局全エキスパートが使われることが多く、小さなサブセットだけでは信頼性が低いという課題がありました。
EMOはこの問題を解決するため、文書レベルのルーティング制約を導入しました。訓練中、同一文書内の全トークンは共有エキスパートプールからのみエキスパートを選択するよう制限されます。このプールはルーターが文書全体の好みを平均して自動的に決定します。また、負荷分散はグローバルに適用され、異なる文書が全エキスパートをカバーするよう促します。エキスパートプールのサイズはランダムにサンプリングされ、推論時に様々なサブセットサイズをサポートします。
実験結果によれば、EMOは汎用ベンチマークで標準MoEと同等の性能を示しつつ、選択的エキスパート使用時には顕著な堅牢性を発揮します。エキスパートの25%(32個)のみを維持した場合、性能低下は約1%に留まり、12.5%(16個)でも全体で3%程度の低下です。一方、標準MoEではサブセットが小さくなるにつれて性能が急激に悪化し、最小設定ではランダムに近い結果となりました。エキスパートの選択は非常に効率的で、少数の例示から適切なサブセットを特定できます。
クラスタリング分析の結果、EMOのエキスパートは「健康・医療」「ニュース」「米国政治」「映画・音楽」などの意味領域に対応していることが分かりました。標準MoEでは「前置詞」「固有名詞」などの低レベルの語彙パターンに特化する傾向があり、この違いがモジュール性の鍵です。
Ai2はEMOモデル、比較用の標準MoEベースライン、そして訓練コードを公開しています。研究チームは、EMOを大規模スパースモデルのモジュール化に向けた初期ステップと位置づけ、エキスパートサブセットの選択・合成の改善、モジュール更新手法、解釈可能性の向上など、今後の研究課題を挙げています。コミュニティと協力し、よりデプロイしやすく、適応・検査・合成が容易なモジュラー言語モデルの実現を目指します。