跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

大型語言模型的對抗性攻擊

文章摘要

本文全面調查了針對大型語言模型的對抗性攻擊,涵蓋威脅模型、攻擊型別(包括標記操縱、基於梯度的攻擊、越獄提示和紅隊測試技術),並討論了黑盒和白盒設定下的挑戰與方法。

大型語言模型的對抗性攻擊
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

大型語言模型(LLM)在現實世界中的應用因ChatGPT的釋出而加速。OpenAI等團隊透過RLHF等對齊過程為模型內建了安全行為,但對抗性攻擊或越獄提示仍可能觸發不良輸出。本文是Lilian Weng於2023年10月發表的綜述,系統探討了LLM的對抗性攻擊。

對抗性攻擊的研究早期集中於影像領域,但文本的離散性使得攻擊更具挑戰性。攻擊分為黑盒(僅能訪問API)和白盒(完全訪問模型引數)。攻擊目標包括分類任務(使模型誤分類)和生成任務(輸不安全內容)。綜述假設攻擊僅發生在推理時,模型權重固定。

攻擊型別包括標記操作、梯度基攻擊、越獄提示、人類紅隊和模型紅隊。標記操作例如TextFooler和BERT-Attack,透過識別重要單詞並替換為同義詞或語義相似詞來欺騙模型,屬於黑盒攻擊。EDA則進行同義詞替換、隨機插入等資料增強。SEARs基於手工規則進行最小化標記修改。

梯度基攻擊依賴白盒設定中的梯度訊號。GBDA使用Gumbel-Softmax近似使對抗損失可微,並加入流暢性和相似性約束。HotFlip透過一階泰勒展開選擇最優字元翻轉。Universal Adversarial Triggers (UAT) 尋找輸入無關的短觸發序列,可跨模型遷移。ARCA則透過隨機座標上升最佳化輸入輸出對以滿足特定行為模式。

越獄提示透過競爭目標(如讓模型始終遵循指令與安全目標衝突)和泛化不匹配(如使用Base64編碼或特殊字元)來繞過安全限制。Wei等人提出了多種組合策略,如字首注入、拒絕抑制、風格注入等。

人類紅隊透過工具輔助提高攻擊效率。Wallace等人設計了對抗寫作介面,顯示單詞重要性。Ziegler等人開發了工具顯示顯著性分數並提供標記替換建議。BAD資料集和Anthropic的紅隊資料集收集了大量人機對話。

模型紅隊使用強化學習訓練專用的紅隊模型。Perez等人採用零樣本、小樣本、監督學習和RL方法生成攻擊。Casper等人提出探索-建立-利用流程,結合人類標籤訓練分類器,再用RL生成多樣化攻擊。FLIRT利用上下文學習迴圈生成攻擊。

緩解策略包括鞍點問題和魯棒性研究。總體而言,LLM的安全性面臨持續挑戰,需要不斷改進防禦機制。

展開要點與分析

文章情報

工程師進階

要點

  • 具有安全對齊的LLM容易受到觸發不良輸出的對抗性輸入的影響。
  • 攻擊範圍從簡單的標記替換到複雜的基於梯度的最佳化。
  • 越獄提示利用競爭目標和泛化不匹配。
  • 紅隊測試(人類或模型)對於識別漏洞至關重要。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。