AI News HubLIVE
站內改寫2 分鐘閱讀

原生多維亞二次運算元:透過輸入依賴的長卷積實現

論文提出HyenaND,一種直接對多維資料原生幾何結構進行操作的亞二次、全域性、輸入依賴運算元。它透過隱式引數化的全域性多維卷積核實現,避免了傳統注意力或迴圈模型中的結構破壞問題。CUDA實現nSubQ融合FFT卷積路徑,實現O(L log L)縮放加速。在長上下文基因組學、計算機視覺、醫學影像和PDE建模中,純HyenaND堆疊匹配強注意力基線,混合配置超越純注意力和強迴圈混合模型。

來源arXiv Machine Learning作者: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

近年來,隨著深度學習模型處理的資料維度越來越高,傳統注意力機制的二次複雜度成為瓶頸。現有的亞二次替代方案在處理影像、體積和偏微分方程(PDE)等多維資料時,往往需要做出妥協:標準卷積缺乏全域性感受野和輸入依賴性,而迴圈模型則要求將資料光柵化為一維掃描順序,從而破壞了資料的空間結構。針對這一問題,由David R. Wessels等12位研究人員組成的團隊提出了HyenaND,一種全新的亞二次、全域性、輸入依賴運算元,能夠直接作用於多維資料的原生幾何結構。

HyenaND的核心思想是透過卷積操作與隱式引數化的全域性、輸入依賴的多維卷積核進行運算。這種設計使得HyenaND無需像傳統方法那樣犧牲空間結構或全域性資訊,即可實現亞二次的計算複雜度。具體而言,HyenaND的卷積核是隱式引數化的,這意味著它不需要顯式儲存整個卷積核,從而降低了記憶體開銷。同時,卷積核是輸入依賴的,能夠根據輸入資料動態調整,增強了模型的自適應性。

為了將理論優勢轉化為實際效能提升,團隊提供了名為nSubQ的CUDA實現。nSubQ透過融合FFT卷積路徑,將HyenaND的O(L log L)理論複雜度轉化為實際的加速比。這一實現充分利用了GPU的平行計算能力,使得HyenaND在大規模資料上的運算速度顯著提升。

在實驗部分,團隊在長上下文基因組學、計算機視覺、醫學影像和PDE建模等多個領域進行了評估。結果表明,純HyenaND堆疊能夠匹配甚至超越強注意力基線的準確率。更引人注目的是,將HyenaND與注意力層交錯組合的混合配置,在效能上超越了純注意力和基於迴圈的強混合模型。這一成果不僅為高效處理多維資料提供了新的工具,也為未來設計更高效的神經網路架構奠定了基礎。

HyenaND的提出標誌著亞二次運算元領域的重要進展,它解決了長期困擾研究者的多維資料結構破壞問題,同時保持了計算高效性。隨著nSubQ實現的開源,預計將廣泛應用於需要處理高維資料的場景,如醫學影像分析、氣候建模和基因組學研究等。