AI News HubLIVE
站内改写2 分钟阅读

用于Transformer模型压缩的鲁棒基样条解耦方法

本文提出了一种基于B样条的解耦框架R-CMTF-BSD,通过约束耦合矩阵-张量分解与鲁棒交替最小二乘算法,实现Transformer模型参数的大幅压缩,同时保持精度。在Vision和Swin Transformer上的实验表明,该方法能显著减少参数并维持竞争性准确率。

来源arXiv Machine Learning作者: Joppe De Jonghe, Van Tien Pham, Mariya Ishteva

在深度学习中,模型压缩对于将大型神经网络部署到资源受限的设备上至关重要。解耦(Decoupling)作为一种强大的建模范式,通过将多元函数表示为线性变换与单变量非线性函数的组合,提供了一种结构化的近似方法,从而显著降低参数复杂度。单层解耦可以视为一个具有单隐层和灵活激活函数的全连接神经网络,这使其与神经网络有着天然的联系。正因如此,解耦方法在神经网络领域,尤其是模型压缩中,受到了越来越多的关注。

然而,现有的基于张量的解耦方法通常采用多项式或分段线性函数来参数化内部的非线性函数。这些方法存在明显的缺陷:多项式参数化在高阶时容易产生数值不稳定性,而分段线性函数则受限于其固定的分段结构,表达能力有限。为了克服这些局限,研究人员提出了一种基于B样条(B-spline)的解耦框架,该框架推广了现有的方法。

B样条具有局部支撑性和灵活的光滑性控制能力,这使得新提出的表示形式在数值上更加稳定,同时具备更强的表达能力。基于这一思想,作者进一步推导了约束耦合矩阵-张量分解(constrained coupled matrix-tensor factorization),并设计了一种鲁棒交替最小二乘算法,称为R-CMTF-BSD。该算法引入了归一化和Tikhonov正则化,以提高求解过程的鲁棒性和收敛性。

为了验证方法的有效性,研究团队在合成数据和真实Transformer架构上进行了实验。具体来说,他们测试了Vision Transformer(ViT)和Swin Transformer两种主流视觉模型。实验结果表明,B样条解耦能够在保持竞争性精度的前提下,大幅减少模型参数。以ViT为例,参数压缩比达到数倍,且分类准确率下降幅度极小。这一成果使得R-CMTF-BSD算法成为结构化神经网络压缩领域的一个有前景的工具。

该论文由Joppe De Jonghe等三位作者完成,于2026年5月11日提交至arXiv预印本平台。读者可通过论文页面获取完整的PDF版本和进一步的细节。这项研究为未来更高效的模型压缩技术奠定了基础,特别是在Transformer模型日益庞大的背景下,其意义尤为突出。