AI News HubLIVE
站內改寫2 分鐘閱讀

面向推理的思維感知KV快取壓縮:基於自適應注意力匹配

推理語言模型在生成長思維鏈時,KV快取會線性增長併成為解碼階段的記憶體瓶頸。現有壓縮方法將推理軌跡視為扁平序列進行統一壓縮,忽略了思維鏈內部不同步驟的重要性差異。新研究提出TAM方法,透過思維分割、自適應預算分配和關鍵token保護,在同等記憶體佔用下提升準確率,並利用週期性壓縮將峰值記憶體降低約65%。

來源arXiv Computational Linguistics作者: Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu

推理語言模型在回答複雜問題時,會生成很長的思維鏈(chain-of-thought, CoT),這些內部推理步驟能顯著提升最終答案質量。然而,隨著思維鏈不斷延長,模型在解碼階段維護的鍵值快取(key-value cache, KV cache)也線性增長,成為部署和推理時的主要記憶體瓶頸。為此,研究者一直在探索快取壓縮技術,但現有方法大多把推理軌跡看成一段扁平的token序列,用統一的壓縮策略“一視同仁”,沒有顧及思維鏈內部的結構差異——有些推理步可能至關重要,另一些則只是過渡性內容。

在這篇題為“Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching”的論文中,作者提出了一種名為TAM的新方法。TAM的核心是利用思維鏈的層次化結構,透過三個機制來壓縮KV快取。首先是思維分割,把完整推理軌跡切分成若干有意義的推理塊;其次是自適應預算分配,根據每個推理塊的相對重要性和規模分配不同的壓縮預算;最後是關鍵token保護,確保那些注意力權重高、承載關鍵推理錨點的token在壓縮過程中不會被破壞。論文從理論上證明了TAM的預算分配規則在凸誤差模型下是最優的,並且當KV快取被分段、順序壓縮時,累積誤差仍然保持有界。

實驗部分,作者使用Qwen3-4B模型在AIME 2024和MATH-500兩個推理基準上評估了TAM。結果顯示,在相同記憶體佔用下,TAM的準確率優於統一壓縮方法;同時,採用週期性壓縮把峰值記憶體限制在3.1–3.2 GB,相比未壓縮時降低約65%,並保持有競爭力的準確率。這表明,TAM能夠在保持推理質量的前提下大幅緩解長思維鏈帶來的記憶體壓力。

該論文由Yang Liu等人撰寫,共16頁、5張圖,於2026年6月1日提交至arXiv(編號arXiv:2608.12331),收錄於計算與語言(cs.CL)及人工智慧(cs.AI)方向。論文還提供了HTML實驗版和TeX原始碼,並已透過DataCite獲得arXiv DOI。對於關注高效推理、長上下文部署和大模型記憶體最佳化的研究者來說,這項工作將思維鏈的結構資訊引入快取壓縮,提供了一個新的思路。