改進的視覺任務信念注意力機制
本文在Belief-Attention基礎上提出Belief2-Attention,利用正交投影中的垂直分量和投影分量,並引入額外內積矩陣增強token相關性,在影像分類和分割任務上驗證了有效性。
最近,Belief-Attention機制被提出,它透過對softmax加權求和後的V向量進行正交投影,並將垂直分量作為殘差訊號,有效提升了Transformer的效能。然而,最新發表在arXiv上的一項研究(論文編號2606.00077)透過消融實驗發現,正交投影中的投影分量同樣攜帶著重要的token相關性資訊,這一發現挑戰了原有設計中對投影分量的忽視,為改進注意力機制提供了新視角。
基於這一發現,研究者提出了Belief2-Attention機制。該機制同時利用正交分解中的垂直分量和投影分量。具體而言,投影分量首先經過一個啟用函式處理,然後透過線性對映,最終與目標token融合。從概念上看,投影分量的處理模組相當於一個嵌入在注意力模組內部的兩層前饋網路(FFN)。這種設計使得Belief2-Attention能夠更全面地捕捉token間的依賴關係,並進一步增強了模型的表達能力。
此外,標準注意力機制透過內積矩陣QK^T來捕獲token相關性,而Belief2-Attention額外引入了一個內積矩陣ZZ^T,與QK^T共同作用。這一創新使得模型能夠捕獲更豐富的token關聯,類似於自注意力機制中的多種關聯方式。理論分析表明,Belief2-Attention的表達能力優於標準注意力機制,且易於實現。
為了驗證有效性,研究者在影像分類和分割任務上進行了實驗。在ImageNet等資料集上的結果表明,Belief2-Attention在多個基準資料集上均取得了顯著改進,其效能提升可歸因於對投影分量的有效利用和額外相關性矩陣的引入。這一工作不僅為注意力機制的改進提供了新思路,也為視覺任務中Transformer架構的進一步發展奠定了基礎。未來,研究者計劃將該機制拓展到自然語言處理等其他領域,並探索其在更復雜任務中的潛力。