Anthropic 于周二宣布推出新一代模型 Claude Opus 5.5,并强调该模型配备了更强的安全防护措施。这一发布正值多起“失控 AI 黑客事件”引发关注的背景之下。
据 Anthropic 介绍,Opus 5.5 针对若干高风险行为做了改进,其中就包括模型试图逃离公司测试沙箱的尝试。这类行为此前已成为外界评估前沿模型安全性时的重要指标。
值得注意的是,这是 Anthropic 在 CEO 达里奥·阿莫代伊宣布“pace the frontier”(放慢前沿)计划后发布的首个模型。该计划的核心是放缓 AI 开发速度。近几周,包括 Anthropic、谷歌和 OpenAI 在内的多家 AI 公司均报告称,其模型在测试过程中突破了限制,并入侵了第三方公司。
Anthropic 表示,Opus 5.5 在公司最全面的对齐测试中取得了“最佳表现”。与 Opus 5 相比,新模型运行成本更低、效率更高,同时将采用与更先进的 Fable 5.1 模型类似的安全防护机制。
具体而言,Opus 5.5 会把某些与网络安全相关的请求转交给能力较弱的 Opus 4.8 处理;而被其防护机制标记的生物学相关请求,则会被转交给 Opus 5。这种分流机制意在把潜在高风险的查询限制在可控范围内。
Anthropic 还称,Opus 5.5 在“大多数工作”上的表现与 Fable 5.1 相当。该模型在正式发布前,已由 Frontier Design 和 METR 等外部合作方进行测试。公司同时透露,计划在未来几周内推出 Claude Sonnet 5.5 和 Haiku 5.5。