EMO:預訓練混合專家模型實現湧現模塊化
2026年5月8日,艾倫人工智能研究所(Ai2)發佈了一項重要成果——EMO(Emergent Modularity from pretraining mixture of experts),這是一種全新的混合專家(MoE)模型。與傳統的端到端訓練方法不同,EMO通過創新的訓練策略,使得模塊化結構直接從數據中湧現,無需依賴任何人工定義的先驗知識。
大型語言模型通常作為單一整體進行訓練和部署,但隨着模型參數規模達到萬億級別,這種“一刀切”的方式在計算成本和內存佔用上變得日益昂貴。MoE模型通過引入多個專家(feedforward網絡)並僅為每個輸入激活少量專家,試圖緩解這一問題。然而,現有MoE模型在實際應用中依然需要完整的模型才能正常運作,因為不同令牌可能激活不同專家,導致任務執行時實際上用到了所有專家。
EMO的核心創新在於其文檔級路由約束機制。在訓練過程中,同一文檔內的所有令牌被限制只能從一個共享的專家池中選擇激活專家,這個池由路由器根據平均偏好自動確定。這種設計鼓勵了專家根據語義領域自然分組。為了平衡負載,研究人員採用了全局負載均衡策略,避免了與局部路由約束的衝突,同時隨機採樣專家池大小,增強了模型的泛化能力。
實驗結果顯示,EMO在通用基準測試上與標準MoE性能相當,但在選擇性專家使用上表現出色。僅保留25%的專家(32個)時,性能損失僅約1%;即使保留12.5%的專家(16個),整體性能下降也僅有3%左右。相比之下,標準MoE在相同條件下性能急劇下降,甚至接近隨機水平。更重要的是,專家選擇過程非常高效:僅需少量示例即可確定合適的專家子集。
通過聚類分析,研究者發現EMO的專家集羣映射到清晰的語義領域,如健康、醫療、新聞、政治、電影與音樂等。而標準MoE的集羣則大多對應介詞、專有名詞等低層詞彙模式。這一差異解釋了為什麼EMO允許選擇性的專家子集運行——因為每個子集代表了一個真正的能力領域。
目前,Ai2已開源EMO完整模型、匹配的標準MoE基線以及訓練代碼。研究團隊表示,EMO是邁向模塊化大型稀疏模型的第一步,未來仍有諸多挑戰,如優化專家子集的選取與組合、在不破壞完整模型的情況下更新模塊,以及利用模塊結構提升可解釋性和可控性。他們期待社區共同探索,構建更易部署、適應、審查和組合的模塊化語言模型。