MoE路由是哈夫曼编码吗?发现思维链中的频率-多样性定律
一项新研究揭示了混合专家(MoE)大型语言模型中的路由机制遵循类似哈夫曼编码的原理,其中常见标记由稀疏专家处理,而罕见复杂任务则激活高多样性专家委员会。论文提出了频率-多样性定律,识别了某些模型中的冗余陷阱,并提出了子集差异剪枝以提高效率。
混合专家(Mixture-of-Experts, MoE)架构通过稀疏激活大量专家参数,实现了大规模语言模型的高效扩展,但其路由机制长期以来被视为一个黑箱。近日,一篇来自arXiv的论文(arXiv:2607.20427)揭示,MoE路由并非简单的选择过程,而是哈夫曼编码的一种体现。研究者提出了频率-多样性定律(Frequency-Diversity Law),指出当前最先进的模型如Phi-3.5-MoE和Gemma-4-27B-A4B,自发地充当信息论引擎:对于常见标记,它们分配稀疏的专家资源;而对于思维链轨迹中的罕见复杂任务,则调用高多样性的专家委员会。
然而,研究也发现了一个关键问题。在Qwen3.5-35B-A3B模型中,存在一个冗余陷阱:当有效稀疏度(k/E_eff)足够低时,负载均衡会无意中引入功能冗余,掩盖了底层的哈夫曼效率信号。为了解决这一问题,论文提出了子集差异剪枝(Subset Difference Pruning)策略,这是一种精准去除功能重复专家模块的方法。实验证明,剪枝不仅不会降低推理能力,反而能释放模型潜在的哈夫曼效率,迫使推理逻辑坍缩为精简的高密度路径。
这项研究的启示在于,下一代MoE应超越强制负载均衡,向最小描述长度(Minimum Description Length, MDL)最优性迈进。这意味着,为高频信息分配更短的专家路由编码,为低频信息分配更长、更多样化的编码,从而将路由从一种启发式方法转变为一种有原则的压缩引擎。这为更高效、更可解释的AI系统铺平了道路。研究者还提供了20页的论文和20个图表来详细阐述这些发现。