AI News HubLIVE
站内改写2 分钟阅读

基于幅度的专家掩码对混合专家模型的深度感知敏感性分析

一项新的arXiv研究以XLCoST代码翻译基准为基础,利用基于幅度的专家掩码,系统分析了Qwen3.6-35B-A3B混合专家模型在层级上的敏感性。研究发现,后期MoE层(尤其是35-39层)对激进掩码的容忍度远高于早期和中期层,可以在相对较小的质量损失下大幅减少专家数量。这些结果支持深度感知的压缩策略,并为物理权重手术、基于激活的专家评分和基于训练恢复等技术指明了实用路径。

来源arXiv AI作者: Pradeep Kumar Sharma, Shantanu Godbole, Hritvik Shrivastava

混合专家(Mixture-of-Experts, MoE)架构通过稀疏激活让大语言模型在扩展参数规模的同时保持相对较低的计算成本。不过,现有研究对MoE内部各层的重要性刻画仍不充分,尤其在模型压缩任务中,我们应该优先裁剪哪些层、保留哪些层,仍是一个开放问题。一篇新提交至arXiv的论文针对这一空白,对Qwen3.6-35B-A3B模型进行了系统的逐层敏感性分析。

该模型包含40个MoE层,每层有256个专家,并使用top-8路由。研究者以XLCoST跨语言代码翻译基准为测试平台,采用基于幅度的专家掩码(magnitude-based expert masking)方法,在三个H100 GPU服务器上进行了100、300和500个提示的多阶段实验。所谓幅度掩码,就是根据专家权重幅度大小,优先屏蔽低幅度专家,从而观察不同层对专家移除的容忍程度。

论文的核心发现是:MoE层的敏感性呈现出强烈的深度依赖性。0-9层和10-29层(即早期和中期层)对专家掩码非常脆弱;而30-39层,尤其是35-39层,能够承受对低幅度专家进行的大规模掩码。以300个提示的规模为例,对所有层统一进行30%的掩码时,仅保留150/300个Good+Similar输出;而将掩码集中在后期层时,可以在屏蔽640到1,145个专家的情况下保留249到255/300个Good+Similar输出。

在后续500个提示的保留验证集上,最窄的“很后期”策略(仅对35-39层以50%比例掩码)表现出最佳的质量与掩码专家数量权衡:它保留419/500个Good+Similar输出,同时只屏蔽了10,240个专家中的640个。值得注意的是,这个策略掩码的专家数量远少于全层掩码或较宽泛的后期层策略。

研究还初步探索了将top-k路由宽度从每个token 8个活跃专家减少到6个的效果。在一个100个提示的快速测试中,这一改动带来了可观的墙钟时间下降,且没有损失Good+Similar输出。不过,作者指出,路由宽度缩减目前还无法与激进的专家掩码干净地组合使用,相关相互作用需要进一步研究。

总体而言,这些发现为“深度感知”的MoE专家掩码提供了经验基础,也为物理权重手术、基于激活的专家评分以及基于训练的重建恢复等技术方向铺平了道路。论文以arXiv:2608.13565发布,作者为Pradeep Kumar Sharma等人,提交日期为2026年6月25日。