改进的视觉任务信念注意力机制
本文在Belief-Attention基础上提出Belief2-Attention,利用正交投影中的垂直分量和投影分量,并引入额外内积矩阵增强token相关性,在图像分类和分割任务上验证了有效性。
最近,Belief-Attention机制被提出,它通过对softmax加权求和后的V向量进行正交投影,并将垂直分量作为残差信号,有效提升了Transformer的性能。然而,最新发表在arXiv上的一项研究(论文编号2606.00077)通过消融实验发现,正交投影中的投影分量同样携带着重要的token相关性信息,这一发现挑战了原有设计中对投影分量的忽视,为改进注意力机制提供了新视角。
基于这一发现,研究者提出了Belief2-Attention机制。该机制同时利用正交分解中的垂直分量和投影分量。具体而言,投影分量首先经过一个激活函数处理,然后通过线性映射,最终与目标token融合。从概念上看,投影分量的处理模块相当于一个嵌入在注意力模块内部的两层前馈网络(FFN)。这种设计使得Belief2-Attention能够更全面地捕捉token间的依赖关系,并进一步增强了模型的表达能力。
此外,标准注意力机制通过内积矩阵QK^T来捕获token相关性,而Belief2-Attention额外引入了一个内积矩阵ZZ^T,与QK^T共同作用。这一创新使得模型能够捕获更丰富的token关联,类似于自注意力机制中的多种关联方式。理论分析表明,Belief2-Attention的表达能力优于标准注意力机制,且易于实现。
为了验证有效性,研究者在图像分类和分割任务上进行了实验。在ImageNet等数据集上的结果表明,Belief2-Attention在多个基准数据集上均取得了显著改进,其性能提升可归因于对投影分量的有效利用和额外相关性矩阵的引入。这一工作不仅为注意力机制的改进提供了新思路,也为视觉任务中Transformer架构的进一步发展奠定了基础。未来,研究者计划将该机制拓展到自然语言处理等其他领域,并探索其在更复杂任务中的潜力。