投機的復号(speculative decoding)は、ドラフトトークンを生成し、それを並列で検証することで大規模言語モデルの推論を高速化する手法です。EAGLE-3に代表されるツリーアテンション型のドラフタは広く使われていますが、通常は2つの決定を固定しています。1つは厳密なトークン一致検証ルール、もう1つは静的なドラフトツリー形状です。従来研究では、こうした制約を個別に緩和する試みがありましたが、トレーニング不要の有損検証のための長いドラフトチェーンや、固定トークン予算の下での適応的ツリー形状など、限定的な仮定に依存していました。
AdaptiveSpecは、復号中にすでに生成されている内部シグナルを利用して、各ステップで両方の決定を適応させる、トレーニング不要の手法です。マージン規則では、ターゲットモデルがドラフトトークンに与える確率と、そのtop-1確率との比率が閾値を超えた場合、ドラフトが提案した不一致トークンを受理します。この規則はドラフト長やドラフタのアーキテクチャに依存しません。一方、ツリーポリシーは、ドラフトのtop-1信頼度と、最近のドラフトとターゲットの一致度を示す移動履歴を融合したシグナルに基づき、ドラフトツリーの深さ・幅・ノード数を調整します。これにより、ドラフト総数は単に再分配されるだけでなく、時間とともに変化できるようになります。
これら2つの適応は直交する軸で作用し、効果が複合的に高まります。研究者らは、AdaptiveSpecを本番環境向け推論エンジンSGLang上に実装し、最先端の自己回帰型投機的復号手法であるEAGLE-3と比較しました。DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct、Qwen3-8Bの3つのターゲットモデルを用いた実験では、GSM8K、MATH-500、HumanEvalにおいて、スループットを最大56%向上させながら、タスク精度を93%から完全ロスレスに近い水準で回復しました。本論文はarXiv:2609.02897として公開され、2026年7月3日に投稿されています。