AI News HubLIVE
サイト内リライト2 分で読了

MoEモデルにおけるマグニチュードベースのエキスパートマスキングを用いた深さ認識感度分析

新しいarXiv論文は、XLCoSTコード翻訳ベンチマークを用いて、Qwen3.6-35B-A3B混合エキスパート(MoE)モデルの層別感度を、マグニチュードに基づくエキスパートマスキングによって体系的に分析した。後期のMoE層(特に35〜39層)は初期・中期層よりもはるかに攻撃的なマスキングに耐えられ、比較的小さな品質低下でエキスパートを大幅に削減できることが分かった。この結果は、深さを考慮した圧縮戦略や、物理的な重み手術、活性値ベースのエキスパートスコアリング、学習ベースの回復といった実用手法への道筋を示す。

ソースarXiv AI著者: Pradeep Kumar Sharma, Shantanu Godbole, Hritvik Shrivastava

混合エキスパート(Mixture-of-Experts, MoE)アーキテクチャは、スパースな活性化によって大規模言語モデルの計算効率を保ちながらパラメータ数を拡張できるようにする手法です。しかし、MoEの各層がどの程度重要であるかは、特にモデル圧縮の観点では十分に解明されていません。今回arXivに投稿された論文は、このギャップを埋めるため、Qwen3.6-35B-A3Bモデルを対象に層単位の感度分析を実施しました。

分析対象のモデルは40個のMoE層を持ち、各層に256個のエキスパートが配置され、top-8ルーティングを採用しています。研究チームは、XLCoSTという多言語コード翻訳ベンチマークを使い、マグニチュード(重みの大きさ)に基づいて低マグニチュードのエキスパートから順にマスクする方式を採用しました。実験は3台のH100 GPUサーバー上で、100・300・500プロンプトの複数段階にわたって行われています。

中心的な発見は、層の感度が深さに強く依存するという点です。初期層(0〜9)と中期層(10〜29)はエキスパートのマスキングに対して非常に脆弱で、一部のエキスパートを取り除くだけで出力品質が大きく低下します。一方、後期層(30〜39)、特に35〜39層は、低マグニチュードのエキスパートを積極的にマスクしても品質を維持できることが分かりました。300プロンプトの評価では、全層に対して一律に30%のマスクを適用するとGood+Similar出力が300件中150件しか残りませんでしたが、マスキングを後期層に集中させると、640〜1,145個のエキスパートをマスクした場合でも249〜255件を維持できました。

続いて500プロンプトの保留検証スライスでは、35〜39層だけを50%の割合でマスクする「狭い後期層ポリシー」が最も良い品質とマスク数のトレードオフを示しました。このポリシーは、10,240個の全エキスパートのうち640個だけをマスクしつつ、500件中419件のGood+Similar出力を保持しています。これはより広い範囲をマスクする戦略よりも効率的です。

さらに研究者らは、トークンあたりのアクティブなエキスパート数を8から6に減らすtop-k幅の削減も予備的に検証しました。100プロンプトのプローブでは、壁時計時間の大幅な短縮が観測され、Good+Similarの損失もありませんでした。ただし、このルーティング幅の削減は、攻撃的なエキスパートマスキングとそのまま組み合わせられるわけではなく、相互作用の詳細は今後の課題とされています。

本研究は、MoEエキスパートマスキングにおける深さを考慮した設計の経験的基盤を提供するものです。また物理的な重み手術、活性値に基づくエキスパートスコアリング、学習による回復といった実用的な研究方向への足がかりになると期待されます。論文はarXiv:2608.13565として公開されており、Pradeep Kumar Sharma氏らによって2026年6月25日に提出されました。