AI News HubLIVE
站內改寫1 分鐘閱讀

改進的視覺任務信念注意力機制

本文在Belief-Attention基礎上提出Belief2-Attention,利用正交投影中的垂直分量和投影分量,並引入額外內積矩陣增強token相關性,在圖像分類和分割任務上驗證了有效性。

來源arXiv Computer Vision作者: Guoqiang Zhang

最近,Belief-Attention機制被提出,它通過對softmax加權求和後的V向量進行正交投影,並將垂直分量作為殘差信號,有效提升了Transformer的性能。然而,最新發表在arXiv上的一項研究(論文編號2606.00077)通過消融實驗發現,正交投影中的投影分量同樣攜帶着重要的token相關性信息,這一發現挑戰了原有設計中對投影分量的忽視,為改進注意力機制提供了新視角。

基於這一發現,研究者提出了Belief2-Attention機制。該機制同時利用正交分解中的垂直分量和投影分量。具體而言,投影分量首先經過一個激活函數處理,然後通過線性映射,最終與目標token融合。從概念上看,投影分量的處理模塊相當於一個嵌入在注意力模塊內部的兩層前饋網絡(FFN)。這種設計使得Belief2-Attention能夠更全面地捕捉token間的依賴關係,並進一步增強了模型的表達能力。

此外,標準注意力機制通過內積矩陣QK^T來捕獲token相關性,而Belief2-Attention額外引入了一個內積矩陣ZZ^T,與QK^T共同作用。這一創新使得模型能夠捕獲更豐富的token關聯,類似於自注意力機制中的多種關聯方式。理論分析表明,Belief2-Attention的表達能力優於標準注意力機制,且易於實現。

為了驗證有效性,研究者在圖像分類和分割任務上進行了實驗。在ImageNet等數據集上的結果表明,Belief2-Attention在多個基準數據集上均取得了顯著改進,其性能提升可歸因於對投影分量的有效利用和額外相關性矩陣的引入。這一工作不僅為注意力機制的改進提供了新思路,也為視覺任務中Transformer架構的進一步發展奠定了基礎。未來,研究者計劃將該機制拓展到自然語言處理等其他領域,並探索其在更復雜任務中的潛力。