用於Transformer模型壓縮的魯棒基樣條解耦方法
本文提出了一種基於B樣條的解耦框架R-CMTF-BSD,透過約束耦合矩陣-張量分解與魯棒交替最小二乘演算法,實現Transformer模型引數的大幅壓縮,同時保持精度。在Vision和Swin Transformer上的實驗表明,該方法能顯著減少引數並維持競爭性準確率。
在深度學習中,模型壓縮對於將大型神經網路部署到資源受限的裝置上至關重要。解耦(Decoupling)作為一種強大的建模正規化,透過將多元函式表示為線性變換與單變數非線性函式的組合,提供了一種結構化的近似方法,從而顯著降低引數複雜度。單層解耦可以視為一個具有單隱層和靈活啟用函式的全連線神經網路,這使其與神經網路有著天然的聯絡。正因如此,解耦方法在神經網路領域,尤其是模型壓縮中,受到了越來越多的關注。
然而,現有的基於張量的解耦方法通常採用多項式或分段線性函式來引數化內部的非線性函式。這些方法存在明顯的缺陷:多項式引數化在高階時容易產生數值不穩定性,而分段線性函式則受限於其固定的分段結構,表達能力有限。為了克服這些侷限,研究人員提出了一種基於B樣條(B-spline)的解耦框架,該框架推廣了現有的方法。
B樣條具有區域性支撐性和靈活的光滑性控制能力,這使得新提出的表示形式在數值上更加穩定,同時具備更強的表達能力。基於這一思想,作者進一步推導了約束耦合矩陣-張量分解(constrained coupled matrix-tensor factorization),並設計了一種魯棒交替最小二乘演算法,稱為R-CMTF-BSD。該演算法引入了歸一化和Tikhonov正則化,以提高求解過程的魯棒性和收斂性。
為了驗證方法的有效性,研究團隊在合成資料和真實Transformer架構上進行了實驗。具體來說,他們測試了Vision Transformer(ViT)和Swin Transformer兩種主流視覺模型。實驗結果表明,B樣條解耦能夠在保持競爭性精度的前提下,大幅減少模型引數。以ViT為例,引數壓縮比達到數倍,且分類準確率下降幅度極小。這一成果使得R-CMTF-BSD演算法成為結構化神經網路壓縮領域的一個有前景的工具。
該論文由Joppe De Jonghe等三位作者完成,於2026年5月11日提交至arXiv預印本平臺。讀者可透過論文頁面獲取完整的PDF版本和進一步的細節。這項研究為未來更高效的模型壓縮技術奠定了基礎,特別是在Transformer模型日益龐大的背景下,其意義尤為突出。