推测解码(speculative decoding)通过先让模型生成候选 token,再由目标模型并行验证,从而加速大语言模型推理。基于树注意力的草稿器(如 EAGLE-3)已被广泛采用,但它们通常会固定两个决策:一是采用严格的 token 精确匹配验证规则,二是保持静态的草稿树形状。此前的工作往往只单独放宽其中一个约束,并且依赖较强的前提假设,例如使用长草稿链实现免训练的有损验证,或在固定 token 预算下调整树形结构。
AdaptiveSpec 提出了一种免训练的逐步推测解码方法,其核心思想是利用解码过程中已经产生的内部信号,在每一步同时调整这两个决策。具体而言,margin 规则会比较目标模型在草稿 token 上的概率与其 top-1 概率的比值,若该比值超过阈值,即使草稿 token 与目标模型的贪婪采样结果不一致,也会接受该 token。这一规则不依赖草稿长度,也不依赖底层的草稿器架构。与此同时,逐树策略根据草稿 top-1 置信度与近期接受历史的融合信号,动态调整草稿树的深度、宽度和节点数量。与以往只能在固定预算内重新分配草稿数不同,AdaptiveSpec 允许草稿总数随时变化。
这两种自适应机制作用在不同维度上,并且效果可以叠加。研究者在生产级推理引擎 SGLang 上实现了 AdaptiveSpec,并以目前最先进的自回归推测解码方法 EAGLE-3 为基线进行比较。结果表明,在 DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct 和 Qwen3-8B 三个目标模型上,该方法的吞吐量最高可提升 56%,同时在 GSM8K、MATH-500 和 HumanEval 等基准任务中恢复了 93% 到完全无损的任务准确率。相关论文以 arXiv:2609.02897 发布,提交于 2026 年 7 月 3 日。