AI News HubLIVE
站內改寫2 分鐘閱讀

面向推理的思維感知KV緩存壓縮:基於自適應注意力匹配

推理語言模型在生成長思維鏈時,KV緩存會線性增長併成為解碼階段的內存瓶頸。現有壓縮方法將推理軌跡視為扁平序列進行統一壓縮,忽略了思維鏈內部不同步驟的重要性差異。新研究提出TAM方法,通過思維分割、自適應預算分配和關鍵token保護,在同等內存佔用下提升準確率,並利用週期性壓縮將峯值內存降低約65%。

來源arXiv Computational Linguistics作者: Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu

推理語言模型在回答複雜問題時,會生成很長的思維鏈(chain-of-thought, CoT),這些內部推理步驟能顯著提升最終答案質量。然而,隨着思維鏈不斷延長,模型在解碼階段維護的鍵值緩存(key-value cache, KV cache)也線性增長,成為部署和推理時的主要內存瓶頸。為此,研究者一直在探索緩存壓縮技術,但現有方法大多把推理軌跡看成一段扁平的token序列,用統一的壓縮策略“一視同仁”,沒有顧及思維鏈內部的結構差異——有些推理步可能至關重要,另一些則只是過渡性內容。

在這篇題為“Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching”的論文中,作者提出了一種名為TAM的新方法。TAM的核心是利用思維鏈的層次化結構,通過三個機制來壓縮KV緩存。首先是思維分割,把完整推理軌跡切分成若干有意義的推理塊;其次是自適應預算分配,根據每個推理塊的相對重要性和規模分配不同的壓縮預算;最後是關鍵token保護,確保那些注意力權重高、承載關鍵推理錨點的token在壓縮過程中不會被破壞。論文從理論上證明了TAM的預算分配規則在凸誤差模型下是最優的,並且當KV緩存被分段、順序壓縮時,累積誤差仍然保持有界。

實驗部分,作者使用Qwen3-4B模型在AIME 2024和MATH-500兩個推理基準上評估了TAM。結果顯示,在相同內存佔用下,TAM的準確率優於統一壓縮方法;同時,採用週期性壓縮把峯值內存限制在3.1–3.2 GB,相比未壓縮時降低約65%,並保持有競爭力的準確率。這表明,TAM能夠在保持推理質量的前提下大幅緩解長思維鏈帶來的內存壓力。

該論文由Yang Liu等人撰寫,共16頁、5張圖,於2026年6月1日提交至arXiv(編號arXiv:2608.12331),收錄於計算與語言(cs.CL)及人工智能(cs.AI)方向。論文還提供了HTML實驗版和TeX源碼,並已通過DataCite獲得arXiv DOI。對於關注高效推理、長上下文部署和大模型內存優化的研究者來説,這項工作將思維鏈的結構信息引入緩存壓縮,提供了一個新的思路。