Mistletoe:针对推测解码的隐蔽加速崩溃攻击
研究人员提出了一种名为Mistletoe的新型攻击方法,利用推测解码中草稿模型与目标模型之间的近似误差,通过优化降级目标和语义保持目标,并采用零空间投影机制,大幅降低推测解码的接受长度,从而崩溃加速效果,同时保持输出质量。
推测解码(Speculative Decoding)已成为加速大型语言模型(LLM)推理的常用技术。其核心思想是由一个小型草稿模型快速生成多个候选令牌,再由目标模型并行验证这些令牌。虽然这种并行机制能够显著提升推理速度,但其效率高度依赖于平均接受长度τ——即每个验证步骤中通过检测的草案令牌数量。
来自研究团队的论文《Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding》揭示了一个全新的机制级漏洞。在基于模型的推测解码中,草稿模型需要近似目标模型的分布,然而这种近似不可避免地存在误差。正是这种不匹配,为攻击者提供了一个隐蔽的攻击面:通过施加微小的扰动,攻击者可以在不改变目标模型可见行为的前提下,大幅降低草案令牌被接受的概率。
研究人员提出了名为Mistletoe的攻击方法,直接针对推测解码的接受机制。该方法联合优化两个目标:一是降低草稿与目标模型一致性的降级目标,二是约束目标模型输出分布的语义保持目标。为了解决这两个目标之间的冲突,论文引入了一种零空间投影机制,将降级梯度投影到与局部语义保持方向正交的子空间,从而在抑制草案接受的同时最小化语义漂移。
实验在多种推测解码系统上进行,结果表明Mistletoe能够显著减小平均接受长度τ,导致加速比崩溃,令牌吞吐量下降,而输出质量和困惑度几乎不受影响。这一发现警示,推测解码在带来效率提升的同时,也引入了超出传统输出鲁棒性范畴的机制级攻击面,亟需更鲁棒的加速系统设计。