超越KV重建:投機解碼中MLA草稿模型的功能性重建
本論文提出功能性重建方法,將MHA/GQA轉換為MLA時優化注意力模塊以復現原始響應,而不是隻做KV緩存壓縮。在投機解碼的192種配置評測中,多數任務單元的草稿token接受率獲得實質提升,且無需驗證器監督。
多頭部潛在注意力(MLA)正成為長上下文大語言模型推理中的關鍵技術。與傳統的鍵值(KV)緩存隨序列長度持續增長不同,MLA使用緊湊的潛在狀態來表示注意力鍵值,從而顯著降低解碼時的內存佔用與訪存開銷。然而,目前大多數能力較強的開源檢查點仍基於多頭注意力(MHA)或分組查詢注意力(GQA)。要獲得MLA的緩存效率,通常需要將現有模型轉換為MLA結構,而從零開始重新訓練的成本過高。
投機解碼是另一種互補的加速手段,它通過一個小型草稿模型生成候選token,再由目標模型並行驗證。其加速效果取決於草稿提議與目標驗證之間的對齊程度。論文發現,直接將MHA/GQA轉換為MLA會明顯破壞這種對齊:低秩分解和旋轉位置編碼(RoPE)處理會引入注意力函數誤差。這類誤差在獨立生成時可能尚可接受,但在投機解碼中會顯著降低草稿token的接受率,從而削弱加速收益。
針對這一問題,作者將MLA草稿構建重新定義為“功能性重建”,而不是單純的緩存壓縮。他們提出的端到端(E2E)方法對每個轉換後的MLA注意力模塊進行優化,使其在校準隱狀態上覆現原始MHA/GQA模塊經過輸出投影后的響應。該方法與具體轉換器無關,作為一種後轉換步驟,能夠保留已轉換的緩存和推理圖,並且既不需要驗證器的logits,也不需要驗證器提供監督信號。
研究者在實驗中對四個Llama/Qwen草稿-目標模型對、TransMLA和MHA2MLA兩種轉換器、Hugging Face Transformers與vLLM兩個推理後端,以及四項各含200條提示的任務進行了系統評估,共覆蓋192種模型、轉換器、後端、方法和任務的組合。在0.5個百分點的報告容差下,功能性重建在64個匹配任務單元中的37個上帶來實質性接受率提升,26個單元基本保持不變,僅有1個單元出現實質性下降。
該論文(arXiv:2607.27269)由Weiye Shi等三位作者於2026年7月29日提交至arXiv的cs.LG分類。作者已在GitHub上公開代碼和評測材料,便於社區復現和進一步研究。