跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

以裕度而非窗口為準則:免訓練的分步有損推測解碼

文章摘要

提出 AdaptiveSpec,一種無需訓練的逐步推測解碼方法,通過解碼過程中已有的內部信號,同時自適應地調整 token 接受裕度和草稿樹結構。在 SGLang 生產級推理引擎上,相比 EAGLE-3,吞吐量最高提升 56%,在 GSM8K、MATH-500 和 HumanEval 上恢復 93% 至完全無損的任務準確率。

來源arXiv Computational Linguistics作者: Oszk\'ar Urb\'an, Young D. Kwon, Stylianos I. Venieris, Cecilia Mascolo
以裕度而非窗口為準則:免訓練的分步有損推測解碼
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

推測解碼(speculative decoding)通過先讓模型生成候選 token,再由目標模型並行驗證,從而加速大語言模型推理。基於樹注意力的草稿器(如 EAGLE-3)已被廣泛採用,但它們通常會固定兩個決策:一是採用嚴格的 token 精確匹配驗證規則,二是保持靜態的草稿樹形狀。此前的工作往往只單獨放寬其中一個約束,並且依賴較強的前提假設,例如使用長草稿鏈實現免訓練的有損驗證,或在固定 token 預算下調整樹形結構。

AdaptiveSpec 提出了一種免訓練的逐步推測解碼方法,其核心思想是利用解碼過程中已經產生的內部信號,在每一步同時調整這兩個決策。具體而言,margin 規則會比較目標模型在草稿 token 上的概率與其 top-1 概率的比值,若該比值超過閾值,即使草稿 token 與目標模型的貪婪採樣結果不一致,也會接受該 token。這一規則不依賴草稿長度,也不依賴底層的草稿器架構。與此同時,逐樹策略根據草稿 top-1 置信度與近期接受歷史的融合信號,動態調整草稿樹的深度、寬度和節點數量。與以往只能在固定預算內重新分配草稿數不同,AdaptiveSpec 允許草稿總數隨時變化。

這兩種自適應機制作用在不同維度上,並且效果可以疊加。研究者在生產級推理引擎 SGLang 上實現了 AdaptiveSpec,並以目前最先進的自迴歸推測解碼方法 EAGLE-3 為基線進行比較。結果表明,在 DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct 和 Qwen3-8B 三個目標模型上,該方法的吞吐量最高可提升 56%,同時在 GSM8K、MATH-500 和 HumanEval 等基準任務中恢復了 93% 到完全無損的任務準確率。相關論文以 arXiv:2609.02897 發佈,提交於 2026 年 7 月 3 日。

展開要點與分析

文章情報

工程師進階

要點

  • AdaptiveSpec 無需額外訓練,在每步解碼中同時調整 token 接受規則與草稿樹形狀。
  • 其 margin 規則不依賴草稿長度或草稿器架構,樹策略則允許總草稿數量動態變化。
  • 在 SGLang 上相比 EAGLE-3 吞吐量最高提升 56%,在多種 8B 模型和基準上幾乎不損失準確率。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。