基於幅度的專家掩碼對混合專家模型的深度感知敏感性分析
一項新的arXiv研究以XLCoST程式碼翻譯基準為基礎,利用基於幅度的專家掩碼,系統分析了Qwen3.6-35B-A3B混合專家模型在層級上的敏感性。研究發現,後期MoE層(尤其是35-39層)對激進掩碼的容忍度遠高於早期和中期層,可以在相對較小的質量損失下大幅減少專家數量。這些結果支援深度感知的壓縮策略,併為物理權重手術、基於啟用的專家評分和基於訓練恢復等技術指明瞭實用路徑。
混合專家(Mixture-of-Experts, MoE)架構透過稀疏啟用讓大語言模型在擴充套件引數規模的同時保持相對較低的計算成本。不過,現有研究對MoE內部各層的重要性刻畫仍不充分,尤其在模型壓縮任務中,我們應該優先裁剪哪些層、保留哪些層,仍是一個開放問題。一篇新提交至arXiv的論文針對這一空白,對Qwen3.6-35B-A3B模型進行了系統的逐層敏感性分析。
該模型包含40個MoE層,每層有256個專家,並使用top-8路由。研究者以XLCoST跨語言程式碼翻譯基準為測試平臺,採用基於幅度的專家掩碼(magnitude-based expert masking)方法,在三個H100 GPU伺服器上進行了100、300和500個提示的多階段實驗。所謂幅度掩碼,就是根據專家權重幅度大小,優先遮蔽低幅度專家,從而觀察不同層對專家移除的容忍程度。
論文的核心發現是:MoE層的敏感性呈現出強烈的深度依賴性。0-9層和10-29層(即早期和中期層)對專家掩碼非常脆弱;而30-39層,尤其是35-39層,能夠承受對低幅度專家進行的大規模掩碼。以300個提示的規模為例,對所有層統一進行30%的掩碼時,僅保留150/300個Good+Similar輸出;而將掩碼集中在後期層時,可以在遮蔽640到1,145個專家的情況下保留249到255/300個Good+Similar輸出。
在後續500個提示的保留驗證集上,最窄的“很後期”策略(僅對35-39層以50%比例掩碼)表現出最佳的質量與掩碼專家數量權衡:它保留419/500個Good+Similar輸出,同時只遮蔽了10,240個專家中的640個。值得注意的是,這個策略掩碼的專家數量遠少於全層掩碼或較寬泛的後期層策略。
研究還初步探索了將top-k路由寬度從每個token 8個活躍專家減少到6個的效果。在一個100個提示的快速測試中,這一改動帶來了可觀的牆鍾時間下降,且沒有損失Good+Similar輸出。不過,作者指出,路由寬度縮減目前還無法與激進的專家掩碼乾淨地組合使用,相關相互作用需要進一步研究。
總體而言,這些發現為“深度感知”的MoE專家掩碼提供了經驗基礎,也為物理權重手術、基於啟用的專家評分以及基於訓練的重建恢復等技術方向鋪平了道路。論文以arXiv:2608.13565釋出,作者為Pradeep Kumar Sharma等人,提交日期為2026年6月25日。