超越单一维度压缩:大型语言模型的复合稀疏性前沿
该研究提出一种复合稀疏性框架,结合静态参数剪枝和动态令牌级计算,以延缓性能退化,实验表明在相同总稀疏度下优于单一机制压缩。
大型语言模型(LLMs)的推理成本是实际部署中的关键瓶颈,因此模型压缩技术备受关注。传统的压缩方法主要分为两类:静态参数剪枝(如低秩近似和通道剪枝)和动态令牌级计算(如早期退出或动态层跳过)。然而,当稀疏度超过一定阈值时,单一机制往往导致模型性能急剧下降。来自EIT NLP团队的研究人员提出了一个关键问题:能否将这两种机制结合起来,通过分散压缩负担来延迟这种退化?
为此,他们设计了一个极简的复合稀疏性框架。该框架首先使用低秩近似和通道剪枝对模型进行静态压缩,得到一个紧凑的主干网络;然后,在推理时引入轻量级路由器,根据每个令牌的难度动态跳过某些网络层。这种两阶段设计使得参数稀疏性和计算稀疏性可以独立调节,从而更灵活地探索压缩的最优组合。
在多个语言理解和建模基准(如MMLU、GSM8K、WikiText等)上的实验表明,在相同的总稀疏度下,复合稀疏性始终优于任何一种单一机制。具体而言,在理解类任务上,复合稀疏性将性能衰减点推迟了约10-15%的稀疏度,同时保持了更强的语言建模能力。进一步分析显示,参数剪枝和令牌跳过之间存在明显的跨维度干扰:过度依赖某一维度会限制另一维度的有效性。因此,在固定的稀疏度预算下,近乎平衡的分配(即大致相同的参数稀疏度和计算稀疏度)是最优策略。
这些发现具有重要的实际意义。首先,复合压缩提供了一种立即可行的途径来提升LLM的压缩效率,而无需对模型架构进行大规模修改。其次,该研究揭示了一个更广泛的跨维度稀疏性边界,从根本上限制了进一步压缩的可能性——这一边界可能成为未来稀疏化研究的核心目标。研究者已承诺在GitHub上公开代码(https://github.com/EIT-NLP/LLM-Pruning),以促进社区复现和扩展。该论文由Chao Han、Haozhe Hu和Xiaoyu Shen撰写,于2026年6月29日提交至arXiv。