AI News HubLIVE
站內改寫1 分鐘閱讀

SSOG:近線性視覺注意力——不評分,只引導

作者用少量高斯分佈替代 Transformer 中的縮放點積注意力(SDPA),每個注意力頭擁有固定的幾何位置場,內容只對場做微小調整。該方法在 ImageNet 上追平甚至超過基線,計算複雜度接近線性,並且注意力模式可直接繪圖解讀。

來源Hacker News AI作者: 4rtemi5

Transformer 視覺模型的核心裡,縮放點積注意力(SDPA)幾乎是預設配置:每個 token 都要和其他所有 token 計算“有多在意對方”,得到的 N×N 相似度矩陣完全由內容決定。作者過去曾把點積換成 RBF 核,這一次他想質疑更根本的問題——為什麼網路要對每張影像、每個位置,都從內容出發重新計算“應該看哪裡”?

人類閱讀影像時,並不會拿某個翅膀上的 patch 和所有其他 patch 做相似度搜尋。你已經知道該往哪看:向左一點、向上一點,那裡可能是頭;再遠一點,翅膀在哪裡結束。注意力位置主要來自幾何關係,而不是內容,內容只是微調。於是作者把注意力設計成這種結構:每個注意力頭擁有少數幾個高斯原子,每個原子由五個數描述——中心偏移 (μy, μx)、兩個方向的寬度 (σy, σx)、以及權重 λ。整套欄位在影像間固定不變,就像一個“往哪看”的習慣。為了讓內容參與進來,每個 token 透過一個零初始化的小線性層預測很小的殘差,只對原子位置、寬度和權重做有界調整。整個過程沒有 query-key 點積,內容不參與打分,只負責引導。

實驗結果令人意外。完全忽略內容的固定高斯場,在 ImageNet 上只比 SDPA 低約 1 個百分點;加上內容引導後差距被完全抹平,完整模型甚至超過基線。在小資料集上,這種幾何先驗帶來驚人的 +17 分。可擴充套件性也很好:12M 引數版本在 ImageNet 上達到 72% 準確率,比同規模的 SDPA 模型小 20%,推理開銷低 30%。更關鍵的是,由於二維高斯可以分解成行、列兩個一維濾波,N×N 注意力矩陣根本不會被構建出來,複雜度從二次降為近線性。可解釋性也大大改善:每個頭只剩幾個可見的高斯“團塊”,可以直接畫出來測量,而不是對著熱力圖猜測。文章還提到,2020 年的 Synthesizer 已經說明隨機學習的注意力矩陣也能工作,SSOG 相當於把注意力矩陣強制成一個平滑、平移不變的幾何物件——像卷積一樣帶有空間先驗,但更柔和、作用範圍更長。