SpecLA: 線性注意力模型的高效推測解碼
本文提出了 SpecLA,一種針對有狀態線性注意力模型的推測解碼執行時。它透過拓撲感知核心驗證鏈和樹,儲存驗證過程中產生的緊湊因子以恢復接受狀態,並使用置信剪枝和目標對齊的EAGLE風格草案生成器提供有用候選。在NVIDIA H100上使用公共GDN-1.3B目標,SpecLA實現了比自迴歸解碼高達1.70倍的端到端加速。
線性注意力模型(如Mamba、RWKV等)透過引入迴圈狀態來替代Transformer中不斷增長的鍵值(KV)快取,從而大幅降低了長序列推理過程中的記憶體佔用。然而,這類模型的自迴歸解碼過程仍然需要逐令牌地讀取、更新和寫入這些狀態,導致推理速度受到序列計算瓶頸的限制。推測解碼(Speculative Decoding)是一種透過並行驗證多個草擬令牌來加速自迴歸解碼的有效技術,但現有的推測解碼系統均針對Transformer的KV快取結構設計,無法直接應用於具有狀態依賴的線性注意力模型。其核心挑戰在於:驗證過程必須遵循迴圈依賴關係,僅更新被接受的軌跡;同時,草案生成器需要避擴音交無效候選,以免浪費寶貴的驗證資源。
針對這些問題,研究團隊(Zhibin Wang等7位作者)在2026年7月提交的論文中提出了SpecLA——一個專為有狀態線性注意力模型設計的推測解碼執行時。SpecLA透過拓撲感知的GPU核心高效地驗證鏈狀和樹狀的候選序列,在驗證過程中儲存緊湊的因子表示以恢復被接受的狀態,並採用置信度剪枝策略結合目標對齊的EAGLE風格草案生成器,為驗證器提供高質量的候選。實驗在NVIDIA H100 GPU上進行,使用公開的GDN-1.3B模型作為目標。結果表明,SpecLA實現了高達1.70倍的端到端加速比,且不犧牲生成質量。這一工作為線性注意力模型的高效推理提供了新的解決方案,有望推動其在即時互動式應用中的部署,例如聊天機器人和程式碼生成等場景。
SpecLA的創新之處在於其拓撲感知的驗證核心,能夠高效處理鏈狀和樹狀的候選依賴關係,這在以往的推測解碼系統中未曾涉及。此外,透過儲存驗證過程中產生的緊湊因子,SpecLA可以在接受候選後快速恢復最新的狀態,避免了昂貴的完整序列重新計算。置信度剪枝機制則過濾掉低質量的草案候選,確保了驗證資源的有效利用。該研究目前以arXiv預印本形式釋出(arXiv:2607.16673),屬於計算與語言(cs.CL)領域,未來有望擴充套件到更大規模的模型和不同的硬體平臺。