原生多维亚二次算子:通过输入依赖的长卷积实现
论文提出HyenaND,一种直接对多维数据原生几何结构进行操作的亚二次、全局、输入依赖算子。它通过隐式参数化的全局多维卷积核实现,避免了传统注意力或循环模型中的结构破坏问题。CUDA实现nSubQ融合FFT卷积路径,实现O(L log L)缩放加速。在长上下文基因组学、计算机视觉、医学影像和PDE建模中,纯HyenaND堆栈匹配强注意力基线,混合配置超越纯注意力和强循环混合模型。
近年来,随着深度学习模型处理的数据维度越来越高,传统注意力机制的二次复杂度成为瓶颈。现有的亚二次替代方案在处理图像、体积和偏微分方程(PDE)等多维数据时,往往需要做出妥协:标准卷积缺乏全局感受野和输入依赖性,而循环模型则要求将数据光栅化为一维扫描顺序,从而破坏了数据的空间结构。针对这一问题,由David R. Wessels等12位研究人员组成的团队提出了HyenaND,一种全新的亚二次、全局、输入依赖算子,能够直接作用于多维数据的原生几何结构。
HyenaND的核心思想是通过卷积操作与隐式参数化的全局、输入依赖的多维卷积核进行运算。这种设计使得HyenaND无需像传统方法那样牺牲空间结构或全局信息,即可实现亚二次的计算复杂度。具体而言,HyenaND的卷积核是隐式参数化的,这意味着它不需要显式存储整个卷积核,从而降低了内存开销。同时,卷积核是输入依赖的,能够根据输入数据动态调整,增强了模型的自适应性。
为了将理论优势转化为实际性能提升,团队提供了名为nSubQ的CUDA实现。nSubQ通过融合FFT卷积路径,将HyenaND的O(L log L)理论复杂度转化为实际的加速比。这一实现充分利用了GPU的并行计算能力,使得HyenaND在大规模数据上的运算速度显著提升。
在实验部分,团队在长上下文基因组学、计算机视觉、医学影像和PDE建模等多个领域进行了评估。结果表明,纯HyenaND堆栈能够匹配甚至超越强注意力基线的准确率。更引人注目的是,将HyenaND与注意力层交错组合的混合配置,在性能上超越了纯注意力和基于循环的强混合模型。这一成果不仅为高效处理多维数据提供了新的工具,也为未来设计更高效的神经网络架构奠定了基础。
HyenaND的提出标志着亚二次算子领域的重要进展,它解决了长期困扰研究者的多维数据结构破坏问题,同时保持了计算高效性。随着nSubQ实现的开源,预计将广泛应用于需要处理高维数据的场景,如医学影像分析、气候建模和基因组学研究等。