多级上下文建模实现混合专家模型中的一致专家选择
混合专家模型(MoE)通过将令牌路由到一小部分专家来高效扩展Transformer模型。然而,现有路由器通常基于浅层或孤立的令牌表示来选择专家,导致路由决策不稳定且语义不一致。本文从表示角度重新审视专家选择,并提出多级上下文融合MoE(MCF-MoE)框架,通过整合跨层语义聚合和局部令牌交互的互补信号来构建上下文感知表示,从而实现更信息丰富且一致的专家选择。实验表明,MCF-MoE在路由一致性和下游性能上均优于强基线,凸显了上下文完整性在专家路由中的重要性。
在人工智能领域,混合专家模型(Mixture-of-Experts, MoE)因其能够通过将输入令牌路由到一小部分专家来高效扩展Transformer模型而备受关注。然而,现有路由机制通常基于浅层或孤立的令牌表示进行专家选择,这导致不同层之间的路由决策不稳定且语义上不一致,从而限制了专家模型的有效分工。针对这一关键瓶颈,Shuhan Huang等学者在arXiv上发表的论文中提出了多级上下文融合MoE(Multi-level Context Fusion MOE, MCF-MoE)框架。
该框架从表示学习角度出发,致力于构建具有丰富上下文信息的令牌表示。通过整合跨层语义聚合和局部令牌级别的交互信号,MCF-MoE使得路由决策能够同时捕捉全局语义和局部细节。具体而言,跨层注意力机制负责聚合来自不同层的语义信息,而局部令牌交互则保留细粒度的邻近上下文。这种多级上下文融合策略确保了专家选择的稳定性和一致性。
在语言建模和语言理解基准上的实验验证了MCF-MoE的有效性。与强基线相比,MCF-MoE在路由一致性指标和下游任务性能(如困惑度和GLUE分数)上均取得了显著提升。例如,在GPT-2和BERT等模型上的测试表明,MCF-MoE能够有效减少路由波动,同时提高任务准确率。该研究的代码已公开发布在匿名仓库中,便于研究者复现和进一步探索。这一成果不仅深化了对MoE路由机制的理解,也为构建更稳定、高效的AI模型提供了新思路。未来,MCF-MoE有望在大型语言模型、多模态系统等领域发挥重要作用。