AI News HubLIVE
站内改写2 分钟阅读

重新部署 Claude Fable 5

美国出口管制解除后,Anthropic 宣布将于2026年7月1日重新向全球用户提供Claude Fable 5。同时,Claude Mythos 5已恢复对美国组织的访问。文章详细介绍了事件时间线、安全防护措施更新、行业共识框架的制定以及更深入的政府合作。

Anthropic 宣布,在出口管制解除后,Claude Fable 5 将于2026年7月1日重新向全球用户开放。此前,美国政府于6月12日对最新模型(包括 Claude Fable 5 和 Claude Mythos 5)实施出口管制,要求限制外国国民的访问。由于无法实时验证国籍,Anthropic 暂停了两个模型的所有访问。6月30日,出口管制解除。Fable 5 将在 Claude 平台、Claude.ai、Claude Code 和 Claude Cowork 上提供。Pro、Max、Team 和部分企业计划用户可在7月7日前享受每周使用限额50%的免费额度,之后需使用积分。Mythos 5 也于6月26日获美国政府批准,向一组美国组织恢复访问。Anthropic 继续与政府协调,扩大 Glasswing 项目合作伙伴的访问权限。

事件时间线与安全更新 Anthropic 于6月9日发布 Fable 5 和 Mythos 5。两者共享底层模型,但 Fable 5 具有更强的安全保障。Mythos 5 仅向少数受信任的 Glasswing 合作伙伴开放,用于防御性网络安全。6月12日的出口管制指令源于亚马逊研究人员的一份报告,他们发现了一种绕过 Fable 5 安全措施的方法:通过特定提示让模型识别软件漏洞,并编展示利用代码。Anthropic 与政府及亚马逊合作调查后确认,许多能力较弱的模型也能识别相同漏洞,且所有測試模型都能复现利用演示。报告的技术并未展现任何独特的 Mythos 级网络能力,仅涉及常规防御性网络安全工作。为此,Anthropic 训练了改进的安全分类器,可在99%以上的案例中阻止报告中的技术。研究人员验证了这些防护措施的有效性。新分类器可能导致良性请求被误拦,但 Anthropic 将持续优化。

网络安全防护方法 Claude Mythos 5 在发现和利用软件漏洞方面具有超强能力,而 Claude Fable 5 因强大的防护措施不具备独特攻击能力。Fable 5 采用多层防御机制,包括训练模型拒绝危险请求、分析滥用模式以及使用分类器实时检测有害内容。分类器会拦截可能危险的请求,包括边缘案例。Anthropic 扩大了 Fable 5 的安全裕度,虽增加误报但降低了漏报风险。安全裕度还有助于缓解越狱攻击:大多数越狱仅触及安全裕度或模糊有害行为,无法达到核心有害行为。Anthropic 认为,迄今报告的 Fable 5 越狱均属此类。更严重的越狱可解锁具体有害行为,但通常范围有限;最令人担忧的通用越狱尚未发现。Anthropic 致力于优先发现重大越狱并及时修复。

行业共识框架 目前AI行业缺乏评估越狱严重性的共识标准,这给开发者和政府带来不确定性。Anthropic 与亚马逊、微软、谷歌等 Glasswing 合作伙伴共同起草一个共识框架,以客观描述越狱的严重程度。该框架将帮助AI公司安全发布模型,并让用户充分利用先进能力。Anthropic 还加强了与美国政府的合作,包括预发布测试、信息共享和研究协作。