BitsMoE: MoE LLM量子化のためのスペクトルエネルギー誘導型ビット割り当て
BitsMoEは、混合エキスパート(MoE)大規模言語モデルのための効率的な量子化フレームワークです。SVDを用いて各MoE層を共有基底とエキスパート固有のスペクトル因子に分解し、共有基底は量子化せずに保持することでクロスエキスパート構造を維持します。固定ビット予算下で再構成損失を最小化する整数線形計画問題を定式化します。実験では、Qwen3-30B-A3B-Baseの2ビット量子化において、GPTQと比較して量子化速度12.3倍、平均精度27.83ポイント向上、復号速度1.76倍の改善を達成しました。
混合エキスパート(Mixture-of-Experts, MoE)大規模言語モデルは、スパースなエキスパート活性化によりトークンあたりの計算量を削減しますが、すべてのエキスパート重みをメモリに保持する必要があるため、展開時のメモリ負荷が課題です。既存のMoE圧縮手法は超低ビット量子化領域で課題を抱えており、プルーニングはモデルの能力を不可逆的に削減し、粗粒度量子化はエキスパートや重み方向の重要度に応じたビット割り当てができません。本研究では、この問題を解決するために、スペクトルエネルギー誘導型ビット割り当てフレームワークBitsMoEを提案します。
BitsMoEは、各MoE層を特異値分解(SVD)により共有基底とエキスパート固有のスペクトル因子に分解します。共有基底は量子化せずに保持し、クロスエキスパート構造を保存します。エキスパート固有因子は細粒度の量子化単位として扱います。各単位のビット幅を決定するため、スペクトル単位の混合精度量子化を活性化認識型の再構成サロゲートとして定式化し、固定ビット予算下で推定再構成損失を最小化する整数線形計画(ILP)問題を解きます。これにより、各スペクトル因子の実際の重要度に応じたビット割り当てが可能となります。
複数のMoE大規模言語モデルでの実験により、BitsMoEは超低ビット量子化領域で下流タスクの精度低下を大幅に軽減することが示されました。特に、Qwen3-30B-A3B-Baseの2ビット量子化では、GPTQと比較して量子化速度12.3倍、平均精度27.83パーセントポイント向上、復号速度1.76倍の改善を達成しました。さらに、BitsMoEの量子化プロセス自体も高速であり、SVD分解とILP求解は効率的に実行できます。論文はarXivで公開され、29ページ、6図、9表から構成され、コードとモデルも公開されています。
BitsMoEの提案は、MoE大規模言語モデルの展開において効果的な圧縮手法を提供し、特にメモリ制限のあるデバイスでの利用に適しています。共有基底の完全精度を維持することで、モデルはクロスエキスパート構造を保持しつつ、ストレージ要件を大幅に削減できます。将来的には、このフレームワークは他のスパースモデルにも拡張される可能性があります。研究チームはコードとモデルを公開しており、再現性も確保されています。