BitsMoE:基于谱能量引导的混合专家大模型量化比特分配方法
BitsMoE是一种针对混合专家(MoE)大语言模型的高效量化框架,通过奇异值分解(SVD)将每一层分解为共享基和专家特有谱因子,保留共享基不量化以保持跨专家共同结构,并对专家特有因子进行细粒度比特分配。该方法将激活感知的混合精度量化建模为整数线性规划问题,在固定比特预算下最小化估计重构损失。实验表明,在2比特量化下,BitsMoE相比GPTQ将量化速度提升12.3倍,平均准确率提高27.83个百分点,解码速度提升1.76倍。
混合专家(Mixture-of-Experts, MoE)大语言模型通过稀疏激活专家来降低每个token的计算量,但由于所有专家权重必须常驻内存,部署时的内存压力依然很大。现有的MoE压缩方法在超低位宽量化场景下表现不佳:剪枝会不可逆地移除模型容量,而粗粒度量化无法根据专家和权重方向的重要性分配比特。针对这一挑战,来自学术界的研究团队提出了BitsMoE——一种基于谱能量引导的比特分配框架,专门用于MoE大语言模型的量化。
BitsMoE的核心创新在于利用奇异值分解(SVD)将每个MoE层分解为一个共享基和多个专家特有的谱因子。共享基保留不量化,以保持跨专家的共同结构;专家特有的谱因子则作为细粒度的量化单元。为了确定每个单元的比特宽度,BitsMoE将频谱级别的混合精度量化形式化为一个激活感知的重建替代问题,并通过求解整数线性规划(ILP),在固定比特预算下最小化估计的重建损失。这种方法使得比特分配能够根据每个谱因子的实际重要性进行优化,而不是采用统一的量化策略。
实验在多个MoE大模型上展开,包括Qwen3-30B-A3B-Base等,结果显示BitsMoE在极端低位宽量化场景下大幅降低了下游任务的精度损失。以Qwen3-30B-A3B-Base模型为例,在2比特量化条件下,BitsMoE相比GPTQ方法实现了12.3倍的量化加速,平均准确率提升27.83个百分点,解码速度提升1.76倍。此外,BitsMoE的量化过程本身也更快,因为SVD分解和ILP求解可以高效完成。研究团队已公开代码和模型,相关论文发表于arXiv,包含29页正文、6张图和9张表格,代码可在GitHub上获取。
BitsMoE的提出为MoE大模型的部署提供了一种有效的压缩方案,尤其适用于内存受限的设备。通过保留共享基的完整精度,模型能够在保持跨专家结构的同时,大幅减少存储需求。未来,该框架有望进一步扩展到其他类型的稀疏模型中,例如混合注意力模型等。这项研究对于推动大语言模型在边缘设备上的应用具有重要意义。