AI News HubLIVE
站内改写2 分钟阅读

超越KV重建:投机解码中MLA草稿模型的功能性重建

本论文提出功能性重建方法,将MHA/GQA转换为MLA时优化注意力模块以复现原始响应,而不是只做KV缓存压缩。在投机解码的192种配置评测中,多数任务单元的草稿token接受率获得实质提升,且无需验证器监督。

来源arXiv Machine Learning作者: Weiye Shi, Fanxu Meng, Muhan Zhang

多头部潜在注意力(MLA)正成为长上下文大语言模型推理中的关键技术。与传统的键值(KV)缓存随序列长度持续增长不同,MLA使用紧凑的潜在状态来表示注意力键值,从而显著降低解码时的内存占用与访存开销。然而,目前大多数能力较强的开源检查点仍基于多头注意力(MHA)或分组查询注意力(GQA)。要获得MLA的缓存效率,通常需要将现有模型转换为MLA结构,而从零开始重新训练的成本过高。

投机解码是另一种互补的加速手段,它通过一个小型草稿模型生成候选token,再由目标模型并行验证。其加速效果取决于草稿提议与目标验证之间的对齐程度。论文发现,直接将MHA/GQA转换为MLA会明显破坏这种对齐:低秩分解和旋转位置编码(RoPE)处理会引入注意力函数误差。这类误差在独立生成时可能尚可接受,但在投机解码中会显著降低草稿token的接受率,从而削弱加速收益。

针对这一问题,作者将MLA草稿构建重新定义为“功能性重建”,而不是单纯的缓存压缩。他们提出的端到端(E2E)方法对每个转换后的MLA注意力模块进行优化,使其在校准隐状态上复现原始MHA/GQA模块经过输出投影后的响应。该方法与具体转换器无关,作为一种后转换步骤,能够保留已转换的缓存和推理图,并且既不需要验证器的logits,也不需要验证器提供监督信号。

研究者在实验中对四个Llama/Qwen草稿-目标模型对、TransMLA和MHA2MLA两种转换器、Hugging Face Transformers与vLLM两个推理后端,以及四项各含200条提示的任务进行了系统评估,共覆盖192种模型、转换器、后端、方法和任务的组合。在0.5个百分点的报告容差下,功能性重建在64个匹配任务单元中的37个上带来实质性接受率提升,26个单元基本保持不变,仅有1个单元出现实质性下降。

该论文(arXiv:2607.27269)由Weiye Shi等三位作者于2026年7月29日提交至arXiv的cs.LG分类。作者已在GitHub上公开代码和评测材料,便于社区复现和进一步研究。