AI News HubLIVE
站內改寫1 分鐘閱讀

MoE路由是哈夫曼編碼嗎?發現思維鏈中的頻率-多樣性定律

一項新研究揭示了混合專家(MoE)大型語言模型中的路由機制遵循類似哈夫曼編碼的原理,其中常見標記由稀疏專家處理,而罕見覆雜任務則啟用高多樣性專家委員會。論文提出了頻率-多樣性定律,識別了某些模型中的冗餘陷阱,並提出了子集差異剪枝以提高效率。

來源arXiv Computational Linguistics作者: Ching-Chieh Tsao, Zhuoyi Lin, Wenya Wang

混合專家(Mixture-of-Experts, MoE)架構透過稀疏啟用大量專家引數,實現了大規模語言模型的高效擴充套件,但其路由機制長期以來被視為一個黑箱。近日,一篇來自arXiv的論文(arXiv:2607.20427)揭示,MoE路由並非簡單的選擇過程,而是哈夫曼編碼的一種體現。研究者提出了頻率-多樣性定律(Frequency-Diversity Law),指出當前最先進的模型如Phi-3.5-MoE和Gemma-4-27B-A4B,自發地充當資訊理論引擎:對於常見標記,它們分配稀疏的專家資源;而對於思維鏈軌跡中的罕見覆雜任務,則呼叫高多樣性的專家委員會。

然而,研究也發現了一個關鍵問題。在Qwen3.5-35B-A3B模型中,存在一個冗餘陷阱:當有效稀疏度(k/E_eff)足夠低時,負載均衡會無意中引入功能冗餘,掩蓋了底層的哈夫曼效率訊號。為了解決這一問題,論文提出了子集差異剪枝(Subset Difference Pruning)策略,這是一種精準去除功能重複專家模組的方法。實驗證明,剪枝不僅不會降低推理能力,反而能釋放模型潛在的哈夫曼效率,迫使推理邏輯坍縮為精簡的高密度路徑。

這項研究的啟示在於,下一代MoE應超越強制負載均衡,向最小描述長度(Minimum Description Length, MDL)最優性邁進。這意味著,為高頻資訊分配更短的專家路由編碼,為低頻資訊分配更長、更多樣化的編碼,從而將路由從一種啟發式方法轉變為一種有原則的壓縮引擎。這為更高效、更可解釋的AI系統鋪平了道路。研究者還提供了20頁的論文和20個圖表來詳細闡述這些發現。