AI News HubLIVE
站內改寫2 分鐘閱讀

用於Transformer模型壓縮的魯棒基樣條解耦方法

本文提出了一種基於B樣條的解耦框架R-CMTF-BSD,通過約束耦合矩陣-張量分解與魯棒交替最小二乘算法,實現Transformer模型參數的大幅壓縮,同時保持精度。在Vision和Swin Transformer上的實驗表明,該方法能顯著減少參數並維持競爭性準確率。

來源arXiv Machine Learning作者: Joppe De Jonghe, Van Tien Pham, Mariya Ishteva

在深度學習中,模型壓縮對於將大型神經網絡部署到資源受限的設備上至關重要。解耦(Decoupling)作為一種強大的建模範式,通過將多元函數表示為線性變換與單變量非線性函數的組合,提供了一種結構化的近似方法,從而顯著降低參數複雜度。單層解耦可以視為一個具有單隱層和靈活激活函數的全連接神經網絡,這使其與神經網絡有着天然的聯繫。正因如此,解耦方法在神經網絡領域,尤其是模型壓縮中,受到了越來越多的關注。

然而,現有的基於張量的解耦方法通常採用多項式或分段線性函數來參數化內部的非線性函數。這些方法存在明顯的缺陷:多項式參數化在高階時容易產生數值不穩定性,而分段線性函數則受限於其固定的分段結構,表達能力有限。為了克服這些侷限,研究人員提出了一種基於B樣條(B-spline)的解耦框架,該框架推廣了現有的方法。

B樣條具有局部支撐性和靈活的光滑性控制能力,這使得新提出的表示形式在數值上更加穩定,同時具備更強的表達能力。基於這一思想,作者進一步推導了約束耦合矩陣-張量分解(constrained coupled matrix-tensor factorization),並設計了一種魯棒交替最小二乘算法,稱為R-CMTF-BSD。該算法引入了歸一化和Tikhonov正則化,以提高求解過程的魯棒性和收斂性。

為了驗證方法的有效性,研究團隊在合成數據和真實Transformer架構上進行了實驗。具體來説,他們測試了Vision Transformer(ViT)和Swin Transformer兩種主流視覺模型。實驗結果表明,B樣條解耦能夠在保持競爭性精度的前提下,大幅減少模型參數。以ViT為例,參數壓縮比達到數倍,且分類準確率下降幅度極小。這一成果使得R-CMTF-BSD算法成為結構化神經網絡壓縮領域的一個有前景的工具。

該論文由Joppe De Jonghe等三位作者完成,於2026年5月11日提交至arXiv預印本平台。讀者可通過論文頁面獲取完整的PDF版本和進一步的細節。這項研究為未來更高效的模型壓縮技術奠定了基礎,特別是在Transformer模型日益龐大的背景下,其意義尤為突出。