LLM遺忘機制在網路安全中的應用:方法、挑戰與新興威脅綜述
大型語言模型在關鍵領域的部署帶來了遺忘能力的缺失,導致隱私洩露和安全風險。本文綜述了基於梯度的LLM遺忘方法,探討其是否真正移除知識或僅抑制表達,並分析了安全、魯棒性和可驗證遺忘的挑戰。
來源arXiv Machine Learning作者: Ruppikha Sree Shankar, Abhishek Bhardwaj, Arnav Doshi, Anusri Nagarajan, Troy Paulus Asia, Saptarshi Sengupta
大型語言模型(LLM)正被越來越多地部署於醫療、金融、教育和決策支援等安全關鍵系統,然而它們無法遺忘這一特性帶來了嚴重的網路安全、隱私和安全風險。敏感個人資訊、受版權保護的材料、危險領域知識以及記憶的訓練資料,在部署後仍存在於數十億引數中,使模型易遭受提取、越獄攻擊、成員推斷和監管不合規。真實事件,如聊天機器人重複私人資訊或編造法律引用導致直接法律和財務損失,已將這一問題置於新興威脅景觀的中心,而非猜測的範疇。
由於在修訂後的語料庫上重新訓練數十億引數的模型在計算上不可行,且LLM中的知識分佈於引數之間並糾纏不清,而非定位於可識別的單元,LLM遺忘已成為主要的網路防禦手段,旨在從訓練後的模型中移除或抑制目標知識,同時不損害模型應有的知識。然而一個核心問題仍未解決:當前方法是否真正移除了知識,還是僅僅阻止模型在普通提示條件下表達它?本綜述從安全、魯棒性和可驗證遺忘的角度審視了LLM遺忘,主要關注基於梯度的方法,這些方法因其與現有訓練管道的相容性及對數十億引數模型的可擴充套件性而主導了該領域。文中詳細討論了各種方法的原理、優缺點,並指出了未來研究方向,包括開發更可靠的遺忘驗證技術和應對對抗性再發現的挑戰。此外,綜述還對比了各類方法在知識移除徹底性、計算開銷和泛化能力上的差異,強調可驗證遺忘的必要性,並指出當前缺乏統一評估基準的問題。