Mistletoe: 投機的デコーディングに対するステルス的な加速崩壊攻撃
研究者らは、投機的デコーディングのドラフターとターゲットモデルの近似誤差を利用した新たな攻撃手法Mistletoeを提案。劣化目的と意味保存目的を最適化し、ヌル空間投影機構を用いて受け入れ長を大幅に削減、加速効果を崩壊させつつ出力品質を維持する。
投機的デコーディング(Speculative Decoding)は、大規模言語モデル(LLM)の推論を高速化するための広く採用された手法である。その仕組みは、小型のドラフターモデルが複数の候補トークンを生成し、ターゲットモデルがそれらを並行して検証するというものだ。この並列処理により推論速度は向上するが、効率は平均受入長τ(各検証ステップで生き残るドラフトトークンの数)に大きく依存する。
論文「Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding」では、モデルベース投機的デコーディングにおける新たな機構レベルの脆弱性を特定した。ドラフターモデルはターゲットモデルの分布を近似するように訓練されるが、その近似は必然的に不完全となる。このドラフターとターゲットのミスマッチが攻撃面を生み出し、小さな摂動でターゲットモデルの見かけ上の振る舞いを保ちつつ、ドラフトトークンの受入率を大幅に低下させることが可能となる。
研究チームは、投機的デコーディングの受入機構を直接標的とするステルス的な加速崩壊攻撃「Mistletoe」を提案する。Mistletoeは、ドラフターとターゲットの一致度を低下させる劣化目的と、ターゲットモデルの出力分布を制約する意味保存目的を共同最適化する。これらの目的間の競合を解決するために、ヌル空間投影機構を導入し、劣化勾配を局所的な意味保存方向から遠ざけることで、意味的ドリフトを最小限に抑えつつドラフト受入を抑制する。
複数の投機的デコーディングシステムでの実験により、Mistletoeは平均受入長τを大幅に減少させ、高速化を崩壊させ、平均トークンスループットを低下させる一方、出力品質とパープレキシティを維持することが示された。この研究は、投機的デコーディングが既存の出力ロバスト性を超えた機構レベルの攻撃面を導入することを浮き彫りにし、よりロバストなLLM高速化システムの設計を求めるものである。