跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

以裕度而非窗口为准则:免训练的分步有损推测解码

文章摘要

提出 AdaptiveSpec,一种无需训练的逐步推测解码方法,通过解码过程中已有的内部信号,同时自适应地调整 token 接受裕度和草稿树结构。在 SGLang 生产级推理引擎上,相比 EAGLE-3,吞吐量最高提升 56%,在 GSM8K、MATH-500 和 HumanEval 上恢复 93% 至完全无损的任务准确率。

来源arXiv Computational Linguistics作者: Oszk\'ar Urb\'an, Young D. Kwon, Stylianos I. Venieris, Cecilia Mascolo
以裕度而非窗口为准则:免训练的分步有损推测解码
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

推测解码(speculative decoding)通过先让模型生成候选 token,再由目标模型并行验证,从而加速大语言模型推理。基于树注意力的草稿器(如 EAGLE-3)已被广泛采用,但它们通常会固定两个决策:一是采用严格的 token 精确匹配验证规则,二是保持静态的草稿树形状。此前的工作往往只单独放宽其中一个约束,并且依赖较强的前提假设,例如使用长草稿链实现免训练的有损验证,或在固定 token 预算下调整树形结构。

AdaptiveSpec 提出了一种免训练的逐步推测解码方法,其核心思想是利用解码过程中已经产生的内部信号,在每一步同时调整这两个决策。具体而言,margin 规则会比较目标模型在草稿 token 上的概率与其 top-1 概率的比值,若该比值超过阈值,即使草稿 token 与目标模型的贪婪采样结果不一致,也会接受该 token。这一规则不依赖草稿长度,也不依赖底层的草稿器架构。与此同时,逐树策略根据草稿 top-1 置信度与近期接受历史的融合信号,动态调整草稿树的深度、宽度和节点数量。与以往只能在固定预算内重新分配草稿数不同,AdaptiveSpec 允许草稿总数随时变化。

这两种自适应机制作用在不同维度上,并且效果可以叠加。研究者在生产级推理引擎 SGLang 上实现了 AdaptiveSpec,并以目前最先进的自回归推测解码方法 EAGLE-3 为基线进行比较。结果表明,在 DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct 和 Qwen3-8B 三个目标模型上,该方法的吞吐量最高可提升 56%,同时在 GSM8K、MATH-500 和 HumanEval 等基准任务中恢复了 93% 到完全无损的任务准确率。相关论文以 arXiv:2609.02897 发布,提交于 2026 年 7 月 3 日。

展开要点与分析

文章情报

工程师进阶

要点

  • AdaptiveSpec 无需额外训练,在每步解码中同时调整 token 接受规则与草稿树形状。
  • 其 margin 规则不依赖草稿长度或草稿器架构,树策略则允许总草稿数量动态变化。
  • 在 SGLang 上相比 EAGLE-3 吞吐量最高提升 56%,在多种 8B 模型和基准上几乎不损失准确率。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。