关于 Fable 5 网络安全防护措施及越狱框架的更多细节
Anthropic 重新部署了 Claude Fable 5,并详细介绍了其网络安全分类器以及一套新的 AI 越狱严重性评估框架。分类器将网络安全相关活动分为四类:禁止使用、高风险双重用途、低风险双重用途和良性使用,并针对不同类别采取不同的阻断或监控策略。公司还提出了一个初步的 AI 越狱严重性框架,旨在与政府、学术界和行业共同讨论,以建立标准。
Anthropic 近日重新部署了其最新的 AI 模型 Claude Fable 5,现已面向全球所有用户开放。伴随此次重新上线,公司公布了更多关于模型网络安全防护机制的细节,特别是其安全分类器的工作原理,以及一套全新的 AI 越狱严重性评估框架。
网络安全分类器
网络安全领域是一个典型的“双重用途”领域——许多技术既可被防御者用于保护系统,也可被攻击者用于破坏。因此,Fable 5 并未简单地对所有网络安全相关请求进行一刀切式的拦截,而是通过训练安全分类器,将相关活动划分为四个层级,并采取不同的处理策略:
- 禁止使用:指那些可能造成严重危害、且几乎没有防御价值的活动,例如勒索软件、破坏性攻击、防御规避、命令与控制信道、数据窃取、恶意软件开发等。对于这些请求,分类器将直接予以阻断。
- 高风险双重用途:这些活动具有较高的潜在危害性,但同时也是安全专业人士日常工作中的一部分,例如渗透测试、权限提升、横向移动、漏洞利用开发等。由于这些行为极易被滥用,Fable 5 默认会将其阻断,直到未来有更好的访问控制机制来确保只有可信用户才能使用。
- 低风险双重用途:这类活动更倾向于防御用途,但同时也可能为攻击者提供一定帮助。例如公开源情报收集、普通漏洞识别、加密协议测试等。对于此类请求,分类器会进行监控,并部分阻断——这构成了所谓的“安全边际”,即宁可误伤一些良性请求,也要确保高风险的请求不会被漏过。
- 良性使用:这些是纯粹的防御性或 IT 运维活动,几乎不存在被滥用的风险,例如常规的安全配置、日志分析等。分类器不会对这类请求进行拦截。
需要注意的是,Fable 5 的安全边际设置得比前代模型更宽,这意味着更多请求(包括部分良性请求)可能会被误拦,但这也大大降低了高风险请求被放行的概率。
AI 越狱严重性框架
除了分类器,Anthropic 还与合作伙伴 Glasswing 共同制定了一个初步的 AI 越狱严重性评估框架。所谓“越狱”,是指通过特殊的提示词绕过模型的安全防护,从而引发原本被禁止的行为。越狱的严重程度各不相同:有些可能只绕过一些微不足道的限制,而另一些则可能解锁大量有害输出,使模型变得极其危险。然而,目前行业内缺乏一个统一的标准来描述越狱的严重性。
Anthropic 此次公布的框架草案旨在提供一个通用语言,让 AI 开发者、政府、学术界和民间社会能够就每个越狱的风险进行一致的讨论。公司欢迎各方反馈,并已在 HackerOne 上启动了漏洞赏金计划,鼓励安全研究人员提交针对 Fable 5 的潜在越狱漏洞。
总结
Fable 5 的网络安全防护体系是多层次的:除了分类器,还包括访问控制、模型安全训练和离线监控。Anthropic 强调,他们希望通过行业合作,建立既允许技术用于防御、又能防止滥用的标准。此次公布的分类细节和越狱框架是这一努力的重要一步。