LISA:線性索引稀疏注意力助力高效長上下文推理
針對長鏈思維推理模型在測試時縮放中面臨的自注意力二次複雜度問題,本文提出LISA(線性索引稀疏注意力),一種即插即用的注意力替換模塊,無需從頭預訓練。LISA並行集成線性注意力和閃電索引器,通過門控機制融合,將推理複雜度從O(n²)降至O(nM)。在DeepSeek蒸餾Qwen模型上的實驗表明,在16K上下文下實現50%推理加速,並在AIME和MATH-500等基準上平均提升5.6%的性能。
近年來,以DeepSeek-R1為代表的長鏈思維推理模型在測試時縮放範式下不斷推長推理上下文長度,使得模型能夠處理更加複雜的推理任務。然而,標準自注意力機制具有O(n²)的計算複雜度,導致長序列推理成本急劇上升,嚴重限制了長CoT推理在生產環境中的部署。為了解決這一瓶頸,研究人員提出了LISA(Linear-Indexed Sparse Attention,線性索引稀疏注意力),這是一種即插即用的注意力替換模塊,無需從頭預訓練即可集成到現有模型中。LISA的設計精巧而高效。它在原始模型內部並行集成了兩個輕量級組件:線性注意力模塊和閃電索引器。線性注意力以O(n)的時間複雜度提供長距離記憶能力,能夠捕捉上下文中的全局依賴關係;而閃電索引器則從完整上下文中選出最重要的前M個令牌,並將其輸入稀疏自注意力機制。這兩個分支通過門控機制融合,從而將生成n個令牌的推理複雜度從O(n²)降低到O(nM),其中M遠小於n。訓練過程採用兩階段流水線。第一階段通過集成線性注意力來捕獲長距離依賴,並結合滑動窗口注意力機制,利用知識蒸餾優化以逼近凍結教師模型的全自注意力分佈。第二階段引入索引器替代靜態滑動窗口機制,實現從更廣上下文中的動態令牌選擇。索引器通過一種新穎的逐頭KL散度損失進行訓練,使其選擇行為與教師模型的注意力模式對齊。在DeepSeek蒸餾後的Qwen模型上進行的實驗表明,LISA在16K令牌上下文下實現了50%的推理加速,同時在包括AIME和MATH-500在內的推理基準上平均性能提升5.6%。這一工作為長上下文推理的高效部署提供了全新的解決方案,有望推動長鏈思維推理模型在實際應用中的廣泛落地。