AI News HubLIVE
サイト内リライト2 分で読了

MoEルーティングはハフマン符号か?チェーン・オブ・ソートにおける頻度多様性則の発見

新しい研究により、混合エキスパート(MoE)大規模言語モデルのルーティングがハフマン符号化と類似の原理に従い、頻出トークンは疎なエキスパートで処理され、稀な複雑タスクは多様なエキスパート委員会を活性化することが明らかになりました。本論文は頻度多様性則を導入し、特定のモデルにおける冗長性の罠を特定し、サブセット差分プルーニングを提案して効率を向上させます。

ソースarXiv Computational Linguistics著者: Ching-Chieh Tsao, Zhuoyi Lin, Wenya Wang

混合エキスパート(MoE)アーキテクチャは、多数のエキスパートパラメータを疎に活性化することで、大規模言語モデルの効率的なスケーリングを実現してきました。しかし、そのルーティングメカニズムは長らくブラックボックスとされてきました。arXivに提出された最近の論文(arXiv:2607.20427)は、MoEルーティングが単なる選択プロセスではなく、ハフマン符号化の現れであることを明らかにしています。研究者らは頻度多様性則(Frequency-Diversity Law)を提唱し、Phi-3.5-MoEやGemma-4-27B-A4Bなどの最先端モデルが情報理論的エンジンとして自発的に動作することを示しました。これらのモデルは、頻出トークンには疎なエキスパートリソースを割り当て、チェーン・オブ・ソート軌跡内の稀な複雑タスクには高多様性のエキスパート委員会を呼び出します。

さらに、Qwen3.5-35B-A3Bモデルには重要な冗長性の罠があることが特定されました。有効疎性(k/E_eff)が十分に低い場合、負荷分散が意図せず機能的冗長性を生み出し、基盤となるハフマン効率信号を隠してしまいます。この問題に対処するため、論文はサブセット差分プルーニング(Subset Difference Pruning)という、機能的重複エキスパートを外科的に除去する戦略を提案しています。実験では、プルーニングは推論能力を低下させず、むしろモデルの潜在的なハフマン効率を解放し、論理を合理化された高密度パスに収束させることが示されました。

この研究の示唆は、次世代のMoEは強制的な負荷分散から脱却し、最小記述長(Minimum Description Length, MDL)最適性に向かうべきであるというものです。すなわち、高頻度情報には短いエキスパートルーティング符号を、低頻度情報にはより長く多様な符号を割り当てることで、ルーティングをヒューリスティックから原理に基づく圧縮エンジンへと変革します。論文は20ページ、20図にわたってこれらの発見を詳述しています。