AI News HubLIVE
サイト内リライト2 分で読了

入力依存の長い畳み込みによるネイティブ多次元二次未満演算子

本論文では、暗黙的にパラメータ化された大域的・入力依存の多次元畳み込みカーネルを用いて、多次元データのネイティブな幾何構造に直接作用する二次未満・大域的・入力依存演算子HyenaNDを提案する。CUDA実装nSubQはFFT畳み込みパスを融合し、O(L log L)スケーリングを実用的な高速化に変換する。長文脈ゲノミクス、コンピュータビジョン、医用画像、PDEモデリングにおいて、純粋なHyenaNDスタックは強力な注意ベースラインに匹敵し、注意層とインターリーブしたハイブリッド構成は純粋な注意や強い再帰ハイブリッドを上回る。

ソースarXiv Machine Learning著者: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

近年、深層学習モデルが扱うデータの次元が増加するにつれて、従来の注意機構の二次計算量がボトルネックとなっています。既存の二次未満代替手法は、画像、ボリューム、偏微分方程式(PDE)などの多次元データを扱う際に妥協を強いられます。標準的な畳み込みは大域的な受容野と入力依存性を欠き、再帰モデルはデータを1次元スキャン順序にラスタライズするため、空間構造を損なってしまいます。この問題に対処するため、David R. Wesselsら12名の研究者からなるチームは、多次元データのネイティブな幾何構造に直接作用する新しい二次未満・大域的・入力依存演算子「HyenaND」を提案しました。

HyenaNDの核心は、暗黙的にパラメータ化された大域的で入力依存の多次元畳み込みカーネルを用いた畳み込み演算にあります。この設計により、HyenaNDは空間構造や大域情報を犠牲にすることなく、二次未満の計算複雑性を実現します。具体的には、畳み込みカーネルが暗黙的にパラメータ化されているため、カーネル全体を明示的に保存する必要がなく、メモリ使用量が削減されます。また、カーネルが入力に依存するため、入力データに応じて動的に調整され、モデルの適応性が向上します。

理論上の利点を実際の性能に変換するため、チームは「nSubQ」というCUDA実装を提供しました。nSubQはFFT畳み込みパスを融合することで、HyenaNDのO(L log L)理論計算量を実用的な高速化に変換します。この実装はGPUの並列計算能力を最大限に活用し、大規模データでの演算速度を大幅に向上させます。

実験では、長文脈ゲノミクス、コンピュータビジョン、医用画像、PDEモデリングなど複数の分野で評価が行われました。結果として、純粋なHyenaNDスタックは強力な注意ベースラインと同等以上の精度を示しました。さらに注目すべきは、HyenaNDと注意層を交互に配置したハイブリッド構成が、純粋な注意や強い再帰ハイブリッドを上回る性能を発揮したことです。この成果は、多次元データを効率的に処理する新たなツールを提供するだけでなく、将来のより効率的なニューラルネットワークアーキテクチャ設計の基盤となります。

HyenaNDの登場は、二次未満演算子の分野における重要な進展を示しています。これは長年にわたって研究者を悩ませてきた多次元データの構造破壊問題を解決しつつ、計算効率を維持します。nSubQ実装がオープンソース化されることで、医用画像解析、気候モデリング、ゲノミクス研究など、高次元データを扱う様々なシナリオでの応用が期待されています。