AI News HubLIVE
站内改写1 分钟阅读

SSOG:近线性视觉注意力——不评分,只引导

作者用少量高斯分布替代 Transformer 中的缩放点积注意力(SDPA),每个注意力头拥有固定的几何位置场,内容只对场做微小调整。该方法在 ImageNet 上追平甚至超过基线,计算复杂度接近线性,并且注意力模式可直接绘图解读。

来源Hacker News AI作者: 4rtemi5

Transformer 视觉模型的核心里,缩放点积注意力(SDPA)几乎是默认配置:每个 token 都要和其他所有 token 计算“有多在意对方”,得到的 N×N 相似度矩阵完全由内容决定。作者过去曾把点积换成 RBF 核,这一次他想质疑更根本的问题——为什么网络要对每张图像、每个位置,都从内容出发重新计算“应该看哪里”?

人类阅读图像时,并不会拿某个翅膀上的 patch 和所有其他 patch 做相似度搜索。你已经知道该往哪看:向左一点、向上一点,那里可能是头;再远一点,翅膀在哪里结束。注意力位置主要来自几何关系,而不是内容,内容只是微调。于是作者把注意力设计成这种结构:每个注意力头拥有少数几个高斯原子,每个原子由五个数描述——中心偏移 (μy, μx)、两个方向的宽度 (σy, σx)、以及权重 λ。整套字段在图像间固定不变,就像一个“往哪看”的习惯。为了让内容参与进来,每个 token 通过一个零初始化的小线性层预测很小的残差,只对原子位置、宽度和权重做有界调整。整个过程没有 query-key 点积,内容不参与打分,只负责引导。

实验结果令人意外。完全忽略内容的固定高斯场,在 ImageNet 上只比 SDPA 低约 1 个百分点;加上内容引导后差距被完全抹平,完整模型甚至超过基线。在小数据集上,这种几何先验带来惊人的 +17 分。可扩展性也很好:12M 参数版本在 ImageNet 上达到 72% 准确率,比同规模的 SDPA 模型小 20%,推理开销低 30%。更关键的是,由于二维高斯可以分解成行、列两个一维滤波,N×N 注意力矩阵根本不会被构建出来,复杂度从二次降为近线性。可解释性也大大改善:每个头只剩几个可见的高斯“团块”,可以直接画出来测量,而不是对着热力图猜测。文章还提到,2020 年的 Synthesizer 已经说明随机学习的注意力矩阵也能工作,SSOG 相当于把注意力矩阵强制成一个平滑、平移不变的几何对象——像卷积一样带有空间先验,但更柔和、作用范围更长。