AI News HubLIVE
站内改写1 分钟阅读

自动可微非线性张量网络(ADNTN)用于深度神经网络的指数级压缩

本文研究自动可微非线性张量网络(ADNTNs),一种结构化权重生成器族,其紧凑核心张量通过反向模式自动微分进行端到端训练。该方法可视为低秩适应和张量分解的自然扩展,通过小核心、非线性激活和可选横向混合张量的层次结构构建大权重张量。论文聚焦于三种架构:树张量网络(TTN)、增强型TTN(aTTN)和多重尺度纠缠重整化拟设(MERA)。实验表明,在AlexNet和VGG-16层上可实现约2000倍至77000倍的逐层压缩比,且精度通常与密集基线相当,在多个VGG-16案例中甚至有所提升。这些结果令人鼓舞,但并非最终结论,表明ADNTNs是一条有前景的数学结构化和硬件感知的路径,但需要联合设计优化、收缩计划和部署内核。

来源arXiv Machine Learning作者: Andrzej Cichocki, Michal Wietczak

自动可微非线性张量网络(ADNTNs)是一种新颖的结构化权重生成方法,旨在以指数级减少深度神经网络所需的参数数量。该研究由Andrzej Cichocki和Michal Wietczak共同完成,论文于2026年5月28日提交至arXiv,隶属于机器学习(cs.LG)和人工智能(cs.AI)领域。

ADNTNs的核心思想是将大型权重张量分解为多个小型核心张量的层次组合,这些核心张量通过反向模式自动微分进行端到端训练。与传统的低秩适应方法不同,ADNTNs不仅仅使用单一的低秩矩阵更新,而是通过非线性激活和可选的横向混合张量构建一个层次化结构。论文重点介绍了三种架构:树张量网络(TTNs)、带有边界解缠器的增强型TTNs(aTTNs)以及多重尺度纠缠重整化拟设(MERA)。

该框架支持非线性激活函数、任务感知目标、批处理以及硬件感知的执行调度。然而,论文明确指出,自动微分并不消除大型中间变量、不良收缩顺序或一般有环张量网络精确收缩的成本。因此,优化和收缩计划的设计至关重要。

在AlexNet和VGG-16层上的大量模拟显示,在研究的设置中,逐层压缩比大约从2000倍到77000倍不等。精度通常与密集基线相当,在几个VGG-16案例中甚至有所提高。这些结果尽管令人鼓舞,但并非最终结论。作者强调,ADNTNs是一条有前景的数学结构化和硬件感知路径,但要实现更小的神经网络,需要同时设计优化、收缩计划和部署内核。

论文包含6张图,共28页,计划提交至期刊和会议。arXiv编号为2606.00130,DOI待注册。