AI News HubLIVE
站內改寫1 分鐘閱讀

超越單一維度壓縮:大型語言模型的複合稀疏性前沿

該研究提出一種複合稀疏性框架,結合靜態參數剪枝和動態令牌級計算,以延緩性能退化,實驗表明在相同總稀疏度下優於單一機制壓縮。

來源arXiv Machine Learning作者: Chao Han, Haozhe Hu, Xiaoyu Shen

大型語言模型(LLMs)的推理成本是實際部署中的關鍵瓶頸,因此模型壓縮技術備受關注。傳統的壓縮方法主要分為兩類:靜態參數剪枝(如低秩近似和通道剪枝)和動態令牌級計算(如早期退出或動態層跳過)。然而,當稀疏度超過一定閾值時,單一機制往往導致模型性能急劇下降。來自EIT NLP團隊的研究人員提出了一個關鍵問題:能否將這兩種機制結合起來,通過分散壓縮負擔來延遲這種退化?

為此,他們設計了一個極簡的複合稀疏性框架。該框架首先使用低秩近似和通道剪枝對模型進行靜態壓縮,得到一個緊湊的主幹網絡;然後,在推理時引入輕量級路由器,根據每個令牌的難度動態跳過某些網絡層。這種兩階段設計使得參數稀疏性和計算稀疏性可以獨立調節,從而更靈活地探索壓縮的最優組合。

在多個語言理解和建模基準(如MMLU、GSM8K、WikiText等)上的實驗表明,在相同的總稀疏度下,複合稀疏性始終優於任何一種單一機制。具體而言,在理解類任務上,複合稀疏性將性能衰減點推遲了約10-15%的稀疏度,同時保持了更強的語言建模能力。進一步分析顯示,參數剪枝和令牌跳過之間存在明顯的跨維度干擾:過度依賴某一維度會限制另一維度的有效性。因此,在固定的稀疏度預算下,近乎平衡的分配(即大致相同的參數稀疏度和計算稀疏度)是最優策略。

這些發現具有重要的實際意義。首先,複合壓縮提供了一種立即可行的途徑來提升LLM的壓縮效率,而無需對模型架構進行大規模修改。其次,該研究揭示了一個更廣泛的跨維度稀疏性邊界,從根本上限制了進一步壓縮的可能性——這一邊界可能成為未來稀疏化研究的核心目標。研究者已承諾在GitHub上公開代碼(https://github.com/EIT-NLP/LLM-Pruning),以促進社區復現和擴展。該論文由Chao Han、Haozhe Hu和Xiaoyu Shen撰寫,於2026年6月29日提交至arXiv。