重要なものを圧縮する:ニューロンの重要度とデータ認識型低ランク近似の融合による言語モデル圧縮
本論文では、ニューロンの重要度とデータ認識型低ランク近似を組み合わせた新しいLLM圧縮手法と、効率的な動的圧縮率割り当てアルゴリズムを提案する。特に高圧縮率において、既存手法を上回る性能を示す。
大規模言語モデル(LLM)は、数十億のパラメータによって多くの分野で優れた性能を発揮しています。しかし、その巨大なメモリ要件により、リソースに制約のある環境での適用が大きく制限されています。この問題に対処するため、ニューラルネットワーク圧縮の分野では特異値分解(SVD)が基本的な手法として広く用いられています。
従来の研究では、低ランク近似をパラメータの重要度に基づくアプローチと、層ごとの機能的等価性に基づくアプローチの2つの視点から個別に研究されてきました。それぞれのアプローチには長所があるものの、これらを組み合わせた試みはほとんどありませんでした。本研究では、これら2つの視点を単一の目的関数に統合する新しいアプローチを提案しています。すなわち、ニューロンの重要度とデータ認識型低ランク近似を融合し、圧縮誤差を最小化するとともに、下流タスクにおける圧縮モデルの性能を最大化します。
さらに、圧縮率の層ごとの配分は圧縮品質に大きな影響を与えます。従来の手法では、圧縮率を全層に均一に割り当てるか、計算コストの高いヒューリスティック探索に依存していました。本研究では、計算効率の良い動的圧縮率割り当てアルゴリズムを提案し、各層の重要度に応じて最適な圧縮率を適応的に決定します。
実験では、複数のデータセットとモデルアーキテクチャを用いて提案手法を評価しました。その結果、提案手法は既存の最先端手法と同等以上の性能を示し、特に高圧縮率において顕著な改善が見られました。この研究は、LLMのリソース制約環境への展開に新たな道を開くものと期待されます。