AI News HubLIVE
站內改寫1 分鐘閱讀

自動可微非線性張量網路(ADNTN)用於深度神經網路的指數級壓縮

本文研究自動可微非線性張量網路(ADNTNs),一種結構化權重生成器族,其緊湊核心張量透過反向模式自動微分進行端到端訓練。該方法可視為低秩適應和張量分解的自然擴充套件,透過小核心、非線性啟用和可選橫向混合張量的層次結構構建大權重張量。論文聚焦於三種架構:樹張量網路(TTN)、增強型TTN(aTTN)和多重尺度糾纏重整化擬設(MERA)。實驗表明,在AlexNet和VGG-16層上可實現約2000倍至77000倍的逐層壓縮比,且精度通常與密集基線相當,在多個VGG-16案例中甚至有所提升。這些結果令人鼓舞,但並非最終結論,表明ADNTNs是一條有前景的數學結構化和硬體感知的路徑,但需要聯合設計最佳化、收縮計劃和部署核心。

來源arXiv Machine Learning作者: Andrzej Cichocki, Michal Wietczak

自動可微非線性張量網路(ADNTNs)是一種新穎的結構化權重生成方法,旨在以指數級減少深度神經網路所需的引數數量。該研究由Andrzej Cichocki和Michal Wietczak共同完成,論文於2026年5月28日提交至arXiv,隸屬於機器學習(cs.LG)和人工智慧(cs.AI)領域。

ADNTNs的核心思想是將大型權重張量分解為多個小型核心張量的層次組合,這些核心張量透過反向模式自動微分進行端到端訓練。與傳統的低秩適應方法不同,ADNTNs不僅僅使用單一的低秩矩陣更新,而是透過非線性啟用和可選的橫向混合張量構建一個層次化結構。論文重點介紹了三種架構:樹張量網路(TTNs)、帶有邊界解纏器的增強型TTNs(aTTNs)以及多重尺度糾纏重整化擬設(MERA)。

該框架支援非線性啟用函式、任務感知目標、批處理以及硬體感知的執行排程。然而,論文明確指出,自動微分並不消除大型中間變數、不良收縮順序或一般有環張量網路精確收縮的成本。因此,最佳化和收縮計劃的設計至關重要。

在AlexNet和VGG-16層上的大量模擬顯示,在研究的設定中,逐層壓縮比大約從2000倍到77000倍不等。精度通常與密集基線相當,在幾個VGG-16案例中甚至有所提高。這些結果儘管令人鼓舞,但並非最終結論。作者強調,ADNTNs是一條有前景的數學結構化和硬體感知路徑,但要實現更小的神經網路,需要同時設計最佳化、收縮計劃和部署核心。

論文包含6張圖,共28頁,計劃提交至期刊和會議。arXiv編號為2606.00130,DOI待註冊。