本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

マージンであってウィンドウではない:トレーニング不要のステップ単位損失許容型投機的デコーディング

記事の要約

AdaptiveSpecは、トレーニング不要で、復号の各ステップにおいてトークン受理のマージンとドラフトツリー形状の両方を、復号中に得られる内部シグナルから適応させる手法。SGLang上でEAGLE-3と比較し、スループットを最大56%向上させつつ、GSM8K・MATH-500・HumanEvalで93%から完全ロスレスのタスク精度を達成する。

ソースarXiv Computational Linguistics著者: Oszk\'ar Urb\'an, Young D. Kwon, Stylianos I. Venieris, Cecilia Mascolo
マージンであってウィンドウではない:トレーニング不要のステップ単位損失許容型投機的デコーディング
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

投機的復号(speculative decoding)は、ドラフトトークンを生成し、それを並列で検証することで大規模言語モデルの推論を高速化する手法です。EAGLE-3に代表されるツリーアテンション型のドラフタは広く使われていますが、通常は2つの決定を固定しています。1つは厳密なトークン一致検証ルール、もう1つは静的なドラフトツリー形状です。従来研究では、こうした制約を個別に緩和する試みがありましたが、トレーニング不要の有損検証のための長いドラフトチェーンや、固定トークン予算の下での適応的ツリー形状など、限定的な仮定に依存していました。

AdaptiveSpecは、復号中にすでに生成されている内部シグナルを利用して、各ステップで両方の決定を適応させる、トレーニング不要の手法です。マージン規則では、ターゲットモデルがドラフトトークンに与える確率と、そのtop-1確率との比率が閾値を超えた場合、ドラフトが提案した不一致トークンを受理します。この規則はドラフト長やドラフタのアーキテクチャに依存しません。一方、ツリーポリシーは、ドラフトのtop-1信頼度と、最近のドラフトとターゲットの一致度を示す移動履歴を融合したシグナルに基づき、ドラフトツリーの深さ・幅・ノード数を調整します。これにより、ドラフト総数は単に再分配されるだけでなく、時間とともに変化できるようになります。

これら2つの適応は直交する軸で作用し、効果が複合的に高まります。研究者らは、AdaptiveSpecを本番環境向け推論エンジンSGLang上に実装し、最先端の自己回帰型投機的復号手法であるEAGLE-3と比較しました。DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct、Qwen3-8Bの3つのターゲットモデルを用いた実験では、GSM8K、MATH-500、HumanEvalにおいて、スループットを最大56%向上させながら、タスク精度を93%から完全ロスレスに近い水準で回復しました。本論文はarXiv:2609.02897として公開され、2026年7月3日に投稿されています。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • AdaptiveSpecは追加トレーニングなしで、各ステップのトークン受理規則とドラフトツリー形状を同時に適応させる。
  • マージン規則はドラフト長やドラフタ構造に依存せず、ツリーポリシーはドラフト総数を動的に変化させられる。
  • SGLang上でEAGLE-3よりスループットを最大56%向上し、複数の8Bモデルとベンチマークでほぼ完全な精度を維持する。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。