AI News HubLIVE
站內改寫2 分鐘閱讀

原生多維亞二次算子:通過輸入依賴的長卷積實現

論文提出HyenaND,一種直接對多維數據原生幾何結構進行操作的亞二次、全局、輸入依賴算子。它通過隱式參數化的全局多維卷積核實現,避免了傳統注意力或循環模型中的結構破壞問題。CUDA實現nSubQ融合FFT卷積路徑,實現O(L log L)縮放加速。在長上下文基因組學、計算機視覺、醫學影像和PDE建模中,純HyenaND堆棧匹配強注意力基線,混合配置超越純注意力和強循環混合模型。

來源arXiv Machine Learning作者: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

近年來,隨着深度學習模型處理的數據維度越來越高,傳統注意力機制的二次複雜度成為瓶頸。現有的亞二次替代方案在處理圖像、體積和偏微分方程(PDE)等多維數據時,往往需要做出妥協:標準卷積缺乏全局感受野和輸入依賴性,而循環模型則要求將數據光柵化為一維掃描順序,從而破壞了數據的空間結構。針對這一問題,由David R. Wessels等12位研究人員組成的團隊提出了HyenaND,一種全新的亞二次、全局、輸入依賴算子,能夠直接作用於多維數據的原生幾何結構。

HyenaND的核心思想是通過卷積操作與隱式參數化的全局、輸入依賴的多維卷積核進行運算。這種設計使得HyenaND無需像傳統方法那樣犧牲空間結構或全局信息,即可實現亞二次的計算複雜度。具體而言,HyenaND的卷積核是隱式參數化的,這意味着它不需要顯式存儲整個卷積核,從而降低了內存開銷。同時,卷積核是輸入依賴的,能夠根據輸入數據動態調整,增強了模型的自適應性。

為了將理論優勢轉化為實際性能提升,團隊提供了名為nSubQ的CUDA實現。nSubQ通過融合FFT卷積路徑,將HyenaND的O(L log L)理論複雜度轉化為實際的加速比。這一實現充分利用了GPU的並行計算能力,使得HyenaND在大規模數據上的運算速度顯著提升。

在實驗部分,團隊在長上下文基因組學、計算機視覺、醫學影像和PDE建模等多個領域進行了評估。結果表明,純HyenaND堆棧能夠匹配甚至超越強注意力基線的準確率。更引人注目的是,將HyenaND與注意力層交錯組合的混合配置,在性能上超越了純注意力和基於循環的強混合模型。這一成果不僅為高效處理多維數據提供了新的工具,也為未來設計更高效的神經網絡架構奠定了基礎。

HyenaND的提出標誌着亞二次算子領域的重要進展,它解決了長期困擾研究者的多維數據結構破壞問題,同時保持了計算高效性。隨着nSubQ實現的開源,預計將廣泛應用於需要處理高維數據的場景,如醫學影像分析、氣候建模和基因組學研究等。