AI News HubLIVE
站内改写2 分钟阅读

面向推理的思维感知KV缓存压缩:基于自适应注意力匹配

推理语言模型在生成长思维链时,KV缓存会线性增长并成为解码阶段的内存瓶颈。现有压缩方法将推理轨迹视为扁平序列进行统一压缩,忽略了思维链内部不同步骤的重要性差异。新研究提出TAM方法,通过思维分割、自适应预算分配和关键token保护,在同等内存占用下提升准确率,并利用周期性压缩将峰值内存降低约65%。

来源arXiv Computational Linguistics作者: Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu

推理语言模型在回答复杂问题时,会生成很长的思维链(chain-of-thought, CoT),这些内部推理步骤能显著提升最终答案质量。然而,随着思维链不断延长,模型在解码阶段维护的键值缓存(key-value cache, KV cache)也线性增长,成为部署和推理时的主要内存瓶颈。为此,研究者一直在探索缓存压缩技术,但现有方法大多把推理轨迹看成一段扁平的token序列,用统一的压缩策略“一视同仁”,没有顾及思维链内部的结构差异——有些推理步可能至关重要,另一些则只是过渡性内容。

在这篇题为“Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching”的论文中,作者提出了一种名为TAM的新方法。TAM的核心是利用思维链的层次化结构,通过三个机制来压缩KV缓存。首先是思维分割,把完整推理轨迹切分成若干有意义的推理块;其次是自适应预算分配,根据每个推理块的相对重要性和规模分配不同的压缩预算;最后是关键token保护,确保那些注意力权重高、承载关键推理锚点的token在压缩过程中不会被破坏。论文从理论上证明了TAM的预算分配规则在凸误差模型下是最优的,并且当KV缓存被分段、顺序压缩时,累积误差仍然保持有界。

实验部分,作者使用Qwen3-4B模型在AIME 2024和MATH-500两个推理基准上评估了TAM。结果显示,在相同内存占用下,TAM的准确率优于统一压缩方法;同时,采用周期性压缩把峰值内存限制在3.1–3.2 GB,相比未压缩时降低约65%,并保持有竞争力的准确率。这表明,TAM能够在保持推理质量的前提下大幅缓解长思维链带来的内存压力。

该论文由Yang Liu等人撰写,共16页、5张图,于2026年6月1日提交至arXiv(编号arXiv:2608.12331),收录于计算与语言(cs.CL)及人工智能(cs.AI)方向。论文还提供了HTML实验版和TeX源码,并已通过DataCite获得arXiv DOI。对于关注高效推理、长上下文部署和大模型内存优化的研究者来说,这项工作将思维链的结构信息引入缓存压缩,提供了一个新的思路。