推測解碼(speculative decoding)透過先讓模型生成候選 token,再由目標模型並行驗證,從而加速大語言模型推理。基於樹注意力的草稿器(如 EAGLE-3)已被廣泛採用,但它們通常會固定兩個決策:一是採用嚴格的 token 精確匹配驗證規則,二是保持靜態的草稿樹形狀。此前的工作往往只單獨放寬其中一個約束,並且依賴較強的前提假設,例如使用長草稿鏈實現免訓練的有損驗證,或在固定 token 預算下調整樹形結構。
AdaptiveSpec 提出了一種免訓練的逐步推測解碼方法,其核心思想是利用解碼過程中已經產生的內部訊號,在每一步同時調整這兩個決策。具體而言,margin 規則會比較目標模型在草稿 token 上的機率與其 top-1 機率的比值,若該比值超過閾值,即使草稿 token 與目標模型的貪婪取樣結果不一致,也會接受該 token。這一規則不依賴草稿長度,也不依賴底層的草稿器架構。與此同時,逐樹策略根據草稿 top-1 置信度與近期接受歷史的融合訊號,動態調整草稿樹的深度、寬度和節點數量。與以往只能在固定預算內重新分配草稿數不同,AdaptiveSpec 允許草稿總數隨時變化。
這兩種自適應機制作用在不同維度上,並且效果可以疊加。研究者在生產級推理引擎 SGLang 上實現了 AdaptiveSpec,並以目前最先進的自迴歸推測解碼方法 EAGLE-3 為基線進行比較。結果表明,在 DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct 和 Qwen3-8B 三個目標模型上,該方法的吞吐量最高可提升 56%,同時在 GSM8K、MATH-500 和 HumanEval 等基準任務中恢復了 93% 到完全無損的任務準確率。相關論文以 arXiv:2609.02897 釋出,提交於 2026 年 7 月 3 日。