演進逐層標量函式實現硬體感知Transformer適配
提出一種基於遺傳程式設計的高效框架,從預訓練權重生成異構逐層標量函式,替代層歸一化,避免全域性歸約瓶頸,僅需20個epoch即可恢復84.25%的Top-1 ImageNet-1K精度,顯著降低計算複雜度和片外記憶體流量,推動ViT在邊緣裝置上的高效部署。
視覺Transformer(ViT)在影像分類、目標檢測等挑戰性視覺任務中取得了最先進的效能,但其在邊緣裝置(如手機、IoT感測器)上的部署面臨兩大障礙:高昂的計算複雜度和層歸一化(Layer Normalization)引入的全域性歸約瓶頸。層歸一化需要在每個Transformer層中對所有token進行統計量計算,導致片外記憶體訪問頻繁,嚴重拖慢推理速度。
近年來,研究人員嘗試用硬體友好的標量近似替換層歸一化,例如使用簡單的縮放或移位操作。但這些方法對所有層採用統一的替換方案,無法適應不同層的行為差異,並且通常需要耗時的模型重新訓練。
針對這一問題,來自Kieran Carrigg等人的團隊提出了一種高效的硬體感知框架。該框架利用遺傳程式設計(Genetic Programming, GP)直接從預訓練權重中為每一層自動演進出一個獨特的標量函式,替代原有的層歸一化。演進過程不需要人工設計,GP演算法透過變異和交叉操作搜尋最優函式形式,目標是最小化與原始歸一化行為的差異。
為了進一步降低部署成本,研究者設計了一種新穎的訓練後重新對齊策略。該策略在演進完成後,僅透過少量樣本對模型的輸出分佈進行微調,無需從頭訓練整個模型。實驗表明,演進得到的表示式能夠準確捕捉原始歸一化的行為,在ImageNet-1K資料集上,其方差解釋度(R²)高達91.6%,而統一的基線方法僅為70.2%。採用這種逐層標量函式後,修改後的ViT架構僅需20個訓練epoch就能恢復84.25%的Top-1準確率,同時完全消除了全域性歸約操作。
更重要的是,該方法在保持效能的同時,大幅降低了算術複雜度和片外記憶體流量。由於不再需要跨token的統計量計算,模型可以在邊緣加速器上高效執行,這為ViT在資源受限裝置上的實際應用掃清了關鍵障礙。該研究為硬體感知的Transformer適配提供了新思路,有望推動視覺基礎模型在邊緣計算場景中的廣泛採用。