ハードウェア対応Transformer適応のための層固有スカラー関数の進化
遺伝的プログラミングを用いて事前学習済み重みから層固有のスカラー関数を進化させ、層正規化を置き換える効率的なハードウェア対応フレームワークを提案。再トレーニング不要で、20エポックでImageNet-1KのTop-1精度84.25%を回復し、均一ベースラインの70.2%に対して91.6%の分散を捕捉。グローバル削減ボトルネックを排除し、エッジデバイスでのViT展開を促進する。
Vision Transformer(ViT)は、画像分類や物体検出などの難しい視覚タスクにおいて最先端の性能を達成していますが、エッジデバイスへの展開は、計算の複雑さと層正規化(Layer Normalization)によるグローバル削減ボトルネックによって大きく妨げられています。層正規化は各Transformer層内の全トークンにわたる統計量を計算する必要があり、その結果、チップ外メモリアクセスが頻発し、推論速度を著しく低下させます。
近年、この問題を回避するために、層正規化をハードウェアに優しいスカラー近似(例えば単純なスケーリングやシフト操作)に置き換える試みが行われてきました。しかし、これらの方法はすべての層に同じ置き換えを適用するため、各層の振る舞いの違いに最適に適応できず、さらに高コストなモデルの再トレーニングを必要とします。
この課題に取り組むため、Kieran Carrigg氏らの研究チームは、遺伝的プログラミング(Genetic Programming, GP)を利用した効率的なハードウェア対応フレームワークを提案しました。このフレームワークは、事前学習済みの重みから直接、各層に特化した異種のスカラー関数を自動進化させ、元の層正規化と置き換えます。進化プロセスは人手による設計を必要とせず、GPアルゴリズムが交叉や突然変異の操作を通じて最適な関数形を探索し、元の正規化動作との差を最小化します。
さらに、展開コストを低減するため、研究者らは新しいトレーニング後再調整戦略を考案しました。この戦略では、進化完了後に少数のサンプルを用いてモデルの出力分布を微調整するだけで、モデル全体を再トレーニングする必要はありません。実験結果によれば、進化した式は元の正規化の振る舞いを正確に近似し、ImageNet-1Kデータセットにおいて分散説明率(R²)が91.6%に達し、均一なベースラインの70.2%を大幅に上回りました。この層別スカラー関数を採用した修正ViTアーキテクチャは、わずか20エポックのトレーニングでTop-1精度84.25%を回復し、同時にグローバル削減操作を完全に排除しました。
さらに重要なことに、本手法は性能を維持しながら、演算複雑性とチップ外メモリトラフィックを大幅に削減します。トークン間の統計量計算が不要になったため、モデルはエッジアクセラレータ上で効率的に動作可能となり、これがリソース制約のあるデバイスへのViTの実用的展開における主要な障壁を取り除きます。この研究は、ハードウェア対応Transformer適応の新たな道を開き、エッジコンピューティングシナリオでのビジョン基盤モデルの広範な採用を促進することが期待されます。