EMO:預訓練混合專家模型實現湧現模組化
2026年5月8日,艾倫人工智慧研究所(Ai2)釋出了一項重要成果——EMO(Emergent Modularity from pretraining mixture of experts),這是一種全新的混合專家(MoE)模型。與傳統的端到端訓練方法不同,EMO透過創新的訓練策略,使得模組化結構直接從資料中湧現,無需依賴任何人工定義的先驗知識。
大型語言模型通常作為單一整體進行訓練和部署,但隨著模型引數規模達到萬億級別,這種“一刀切”的方式在計算成本和記憶體佔用上變得日益昂貴。MoE模型透過引入多個專家(feedforward網路)並僅為每個輸入啟用少量專家,試圖緩解這一問題。然而,現有MoE模型在實際應用中依然需要完整的模型才能正常運作,因為不同令牌可能啟用不同專家,導致任務執行時實際上用到了所有專家。
EMO的核心創新在於其文件級路由約束機制。在訓練過程中,同一文件內的所有令牌被限制只能從一個共享的專家池中選擇啟用專家,這個池由路由器根據平均偏好自動確定。這種設計鼓勵了專家根據語義領域自然分組。為了平衡負載,研究人員採用了全域性負載均衡策略,避免了與區域性路由約束的衝突,同時隨機取樣專家池大小,增強了模型的泛化能力。
實驗結果顯示,EMO在通用基準測試上與標準MoE效能相當,但在選擇性專家使用上表現出色。僅保留25%的專家(32個)時,效能損失僅約1%;即使保留12.5%的專家(16個),整體效能下降也僅有3%左右。相比之下,標準MoE在相同條件下效能急劇下降,甚至接近隨機水平。更重要的是,專家選擇過程非常高效:僅需少量示例即可確定合適的專家子集。
透過聚類分析,研究者發現EMO的專家叢集對映到清晰的語義領域,如健康、醫療、新聞、政治、電影與音樂等。而標準MoE的叢集則大多對應介詞、專有名詞等低層詞彙模式。這一差異解釋了為什麼EMO允許選擇性的專家子集執行——因為每個子集代表了一個真正的能力領域。
目前,Ai2已開源EMO完整模型、匹配的標準MoE基線以及訓練程式碼。研究團隊表示,EMO是邁向模組化大型稀疏模型的第一步,未來仍有諸多挑戰,如最佳化專家子集的選取與組合、在不破壞完整模型的情況下更新模組,以及利用模組結構提升可解釋性和可控性。他們期待社群共同探索,構建更易部署、適應、審查和組合的模組化語言模型。