サイバー防御のためのLLMアンラーニング:手法、課題、新たな脅威に関する調査
大規模言語モデル(LLM)はセキュリティ重要システムに広く使われるが、忘却能力の欠如がプライバシーや安全リスクを生む。本調査は勾配ベースのアンラーニング手法を中心に、知識の真の除去か単なる抑制かを問い、課題を分析する。
大規模言語モデル(LLM)は医療、金融、教育、意思決定支援などのセキュリティ重要システムにますます導入されているが、その忘却能力の欠如は重大なサイバーセキュリティ、プライバシー、安全性のリスクを生み出している。機密性の高い個人情報、著作権で保護された素材、危険なドメイン知識、記憶された訓練データは、展開後も数十億のパラメータにエンコードされたままであり、モデルは抽出、ジェイルブレイク攻撃、メンバーシップ推論、規制違反に対して脆弱である。チャットボットが個人情報を再生したり、でっち上げの法的引用が直接的な法的・金銭的損失を引き起こす実世界のインシデントは、この問題を憶測の領域ではなく新たな脅威の中心に位置づけている。
改訂されたコーパスで数十億パラメータのモデルを再訓練することは計算的に不可能であり、LLM内の知識はパラメータ全体に分散して絡み合っており、識別可能な単位に局在化されていないため、LLMアンラーニングは主要なサイバー防御手段として浮上している。これは、訓練済みモデルから対象知識を除去または抑制し、再訓練を必要とせず、モデルが保持すべき知識を損なわないことを目指す。しかし中心的な疑問は未解決のままである:現在の手法は本当に知識を除去しているのか、それとも通常のプロンプト条件下での表現を抑制しているに過ぎないのか?本調査はセキュリティ、頑健性、検証可能な忘却の観点からLLMアンラーニングを検討し、主に勾配ベースの手法に焦点を当てる。これらの手法は既存の訓練パイプラインとの互換性と数十億パラメータモデルへのスケーラビリティによりこの分野を支配している。本論文では様々な手法の原理、利点、欠点を詳述し、より信頼性の高い忘却検証技術の開発や敵対的再発見への対処など今後の研究方向性を示している。また、知識除去の完全性、計算コスト、汎化能力における手法間の差異を比較し、検証可能な忘却の必要性を強調し、現在統一された評価ベンチマークが不足している問題を指摘している。