Fable 5 のサイバーセーフガードと脱獄フレームワークの詳細
Anthropic は Claude Fable 5 を再展開し、サイバーセキュリティ分類器と新たな AI 脱獄深刻度フレームワークの詳細を公開しました。分類器はサイバーセキュリティ関連の活動を禁止、高リスクの二重用途、低リスクの二重用途、ベニグンの4つに分類し、それぞれ異なるブロックまたは監視ポリシーを適用します。脱獄深刻度フレームワークは、業界、学界、政府間でリスクを議論するための共通言語を確立することを目的としています。
Anthropic は最新の AI モデル Claude Fable 5 を再展開し、現在全世界のユーザーが利用できるようになりました。今回の再展開に伴い、同社はモデルのサイバーセキュリティ保護メカニズム、特にセーフティ分類器の仕組みと、新しい AI 脱獄深刻度評価フレームワークの詳細を公開しました。
サイバーセキュリティ分類器
サイバーセキュリティ分野は典型的な「二重用途」領域であり、多くの技術が防御側にも攻撃側にも利用される可能性があります。そのため、Fable 5 はすべてのサイバーセキュリティ関連リクエストを一律にブロックするのではなく、セーフティ分類器を訓練して関連活動を4つの階層に分類し、異なる処理戦略を適用しています。
- 禁止使用: 重大な害を引き起こす可能性があり、防御的価値がほとんどない活動。ランサムウェア、破壊的攻撃、防御回避、コマンド&コントロール、データ窃取、マルウェア開発などが含まれます。これらのリクエストは分類器によって直接ブロックされます。
- 高リスク二重用途: 潜在的な害は大きいものの、セキュリティ専門家の日常業務の一部でもある活動。ペネトレーションテスト、権限昇格、横方向移動、エクスプロイト開発などが該当します。Fable 5 はこれらの行為をデフォルトでブロックし、将来のアクセス制御まで許可しません。
- 低リスク二重用途: 防御寄りの活動だが、攻撃者にもある程度の価値を提供する可能性があるもの。OSINT、一般的な脆弱性の特定、暗号プロトコルのテストなど。分類器はこれらのリクエストを監視し、一部をブロックします(これが「安全マージン」です)。
- 良性使用: ほぼ完全に防御的または IT 運用に関連し、悪用のリスクがほとんどない活動。例えば、通常のセキュリティ設定やログ分析など。分類器はこれらをブロックしません。
Fable 5 の安全マージンは以前のモデルよりも広く設定されており、一部の良性リクエストが誤ってブロックされる可能性がありますが、高リスクリクエストの通過を防ぐ確実性が高まっています。
AI 脱獄深刻度フレームワーク
Anthropic は Glasswing パートナーと協力して、AI 脱獄の深刻度を評価するための予備的なフレームワークを開発しました。「脱獄」とは、特別なプロンプトによってモデルの安全保護を回避し、禁止された動作を引き出すことです。脱獄の深刻度はさまざまで、些細な制限を回避するものから、モデルを極めて危険にするものまであります。しかし、業界内では脱獄の深刻度を記述する統一された基準が存在しません。
今回のフレームワーク草案は、AI 開発者、政府、学術界、市民社会が各脱獄のリスクについて一貫した言葉で議論できるようにすることを目的としています。Anthropic はフィードバックを歓迎しており、HackerOne 上で報奨金プログラムを開始し、セキュリティ研究者が Fable 5 に対する潜在的な脱獄を提出できるようにしました。
まとめ
Fable 5 のサイバーセキュリティ保護は多層的です。分類器に加えて、アクセス制御、モデルの安全性トレーニング、オフライン監視も使用されています。Anthropic は、業界全体の協力を通じて、テクノロジーが防御に利用される一方で悪用を防ぐ標準を確立したいと考えています。今回の詳細な分類と脱獄フレームワークは、その取り組みの重要な一歩です。