Mistletoe:針對推測解碼的隱蔽加速崩潰攻擊
研究人員提出了一種名為Mistletoe的新型攻擊方法,利用推測解碼中草稿模型與目標模型之間的近似誤差,通過優化降級目標和語義保持目標,並採用零空間投影機制,大幅降低推測解碼的接受長度,從而崩潰加速效果,同時保持輸出質量。
推測解碼(Speculative Decoding)已成為加速大型語言模型(LLM)推理的常用技術。其核心思想是由一個小型草稿模型快速生成多個候選令牌,再由目標模型並行驗證這些令牌。雖然這種並行機制能夠顯著提升推理速度,但其效率高度依賴於平均接受長度τ——即每個驗證步驟中通過檢測的草案令牌數量。
來自研究團隊的論文《Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding》揭示了一個全新的機制級漏洞。在基於模型的推測解碼中,草稿模型需要近似目標模型的分佈,然而這種近似不可避免地存在誤差。正是這種不匹配,為攻擊者提供了一個隱蔽的攻擊面:通過施加微小的擾動,攻擊者可以在不改變目標模型可見行為的前提下,大幅降低草案令牌被接受的概率。
研究人員提出了名為Mistletoe的攻擊方法,直接針對推測解碼的接受機制。該方法聯合優化兩個目標:一是降低草稿與目標模型一致性的降級目標,二是約束目標模型輸出分佈的語義保持目標。為了解決這兩個目標之間的衝突,論文引入了一種零空間投影機制,將降級梯度投影到與局部語義保持方向正交的子空間,從而在抑制草案接受的同時最小化語義漂移。
實驗在多種推測解碼系統上進行,結果表明Mistletoe能夠顯著減小平均接受長度τ,導致加速比崩潰,令牌吞吐量下降,而輸出質量和困惑度幾乎不受影響。這一發現警示,推測解碼在帶來效率提升的同時,也引入了超出傳統輸出魯棒性範疇的機制級攻擊面,亟需更魯棒的加速系統設計。