LLM遗忘机制在网络安全中的应用:方法、挑战与新兴威胁综述
大型语言模型在关键领域的部署带来了遗忘能力的缺失,导致隐私泄露和安全风险。本文综述了基于梯度的LLM遗忘方法,探讨其是否真正移除知识或仅抑制表达,并分析了安全、鲁棒性和可验证遗忘的挑战。
来源arXiv Machine Learning作者: Ruppikha Sree Shankar, Abhishek Bhardwaj, Arnav Doshi, Anusri Nagarajan, Troy Paulus Asia, Saptarshi Sengupta
大型语言模型(LLM)正被越来越多地部署于医疗、金融、教育和决策支持等安全关键系统,然而它们无法遗忘这一特性带来了严重的网络安全、隐私和安全风险。敏感个人信息、受版权保护的材料、危险领域知识以及记忆的训练数据,在部署后仍存在于数十亿参数中,使模型易遭受提取、越狱攻击、成员推断和监管不合规。真实事件,如聊天机器人重复私人信息或编造法律引用导致直接法律和财务损失,已将这一问题置于新兴威胁景观的中心,而非猜测的范畴。
由于在修订后的语料库上重新训练数十亿参数的模型在计算上不可行,且LLM中的知识分布于参数之间并纠缠不清,而非定位于可识别的单元,LLM遗忘已成为主要的网络防御手段,旨在从训练后的模型中移除或抑制目标知识,同时不损害模型应有的知识。然而一个核心问题仍未解决:当前方法是否真正移除了知识,还是仅仅阻止模型在普通提示条件下表达它?本综述从安全、鲁棒性和可验证遗忘的角度审视了LLM遗忘,主要关注基于梯度的方法,这些方法因其与现有训练管道的兼容性及对数十亿参数模型的可扩展性而主导了该领域。文中详细讨论了各种方法的原理、优缺点,并指出了未来研究方向,包括开发更可靠的遗忘验证技术和应对对抗性再发现的挑战。此外,综述还对比了各类方法在知识移除彻底性、计算开销和泛化能力上的差异,强调可验证遗忘的必要性,并指出当前缺乏统一评估基准的问题。