AI News HubLIVE
站内改写1 分钟阅读

压缩关键:结合神经元重要性与数据感知低秩近似的大语言模型压缩

本文提出了一种融合神经元重要性和数据感知低秩近似的新方法,用于压缩大语言模型,同时提出了一种计算高效的动态压缩率分配算法。实验表明,该方法在高压缩率下性能显著优于现有技术。

来源arXiv Machine Learning作者: Athanasios Ntovas, Alexandros Doumanoglou, Petros Drakoulis, Dimitris Zarpalas

大语言模型(LLM)凭借其数十亿参数在自然语言处理等众多领域取得了突破性进展。然而,巨大的参数量带来了高昂的内存消耗,严重限制了其在边缘设备、移动终端等资源受限环境中的部署和应用。为了解决这一关键挑战,模型压缩技术应运而生,其中奇异值分解(SVD)作为一种经典的矩阵分解方法,被广泛应用于神经网络权重的低秩近似压缩。

在早期的研究中,学者们主要从两个不同的视角探索低秩近似:一是基于参数重要性的方法,即保留对模型性能贡献最大的参数,舍弃相对不重要的部分;二是基于逐层功能等价性的方法,即确保压缩后的每一层在功能上尽可能接近原始层。尽管这两种方法各有优势,但此前的工作通常将它们视为独立的研究方向,未能有效融合。

本文提出了一种创新的压缩框架,将神经元重要性度量与数据感知的低秩近似有机结合起来,在一个统一的目标函数中同时考虑参数重要性和逐层功能等价性。通过这种方式,模型能够在压缩过程中更精准地保留关键信息,从而最小化压缩误差并最大化下游任务的性能。此外,压缩率的分配是影响压缩质量的关键因素。以往的方法多采用均匀分配或依赖计算成本高昂的启发式搜索来确定每一层的压缩率。本文则提出了一种增强的计算高效动态压缩率分配算法,该算法能够根据每一层的重要性自适应地调整压缩比率,在保证性能的同时大幅降低了计算开销。

在广泛的实验评估中,作者在多个标准数据集和模型架构上验证了所提方法的有效性。实验结果表明,与现有的最先进压缩技术相比,本文方法在多种压缩率下均能达到相当或更好的性能,尤其是在高压缩率(如压缩至原始大小的10%以下)的情况下,性能提升尤为显著。这一成果为LLM的实际部署提供了更加高效可行的压缩方案,有望推动大型模型在更多实际场景中的应用。