Anthropic Opus 5:性能接近Fable 5,价格减半
Anthropic发布Opus 5,性能接近旗舰模型Fable 5,但价格仅为后者一半。新模型在多项基准测试中表现优异,尤其在知识工作和编码方面。Anthropic强调其安全性和对齐性,并推出快速模式等新功能。
Anthropic于周五发布了Opus 5,这是其前旗舰模型系列的最新版本。尽管Fable 5作为公司的顶级模型推出,但Opus 5在多个领域的表现已接近Fable 5,而价格仅为后者的一半——每百万输入/输出代币费用保持$5/$25不变,与Opus 4.8相同。与Fable 5不同,用户无需选择加入30天的数据保留政策即可使用Opus 5。目前,Opus 5已成为Claude Max用户的默认模型,也是Claude Pro订阅用户能访问的最佳模型。
Opus 5是Anthropic迄今为止最强大的Opus模型,能够更长时间地自主工作,自我检查并从错误中恢复。然而,Anthropic表示,对于“最雄心勃勃的工作”和需要数天自主性的项目,Fable 5仍是首选。Opus 4则被描述为“设计用于日常使用”。值得注意的是,在Anthropic分享的几乎所有基准测试中,Opus 5实际上都超越了Fable 5,而Fable 5的优势主要在于长时间处理复杂项目的能力。
在基准测试方面,Opus 5在知识工作基准GDPval-AA v2上获得1861分,领先于Fable 5(1747)、GPT-5.6 Sol(1736)和Opus 4.8(1593)。在Zapier的AutomationBench(衡量AI代理端到端业务工作流)上,Opus 5的通过率是同等成本下次优模型的两倍,即使在最低努力设置下,其通过的任务也超过其他任何模型。在编码方面,Anthropic表示,在CursorBench 3.2上,Opus 5在高、超高和最大设置下均实现了每成本的最佳性能;在最大努力下,其得分仅比Fable 5的峰值低0.5%,而每任务成本减半。
安全方面,Anthropic称Opus 5是其迄今为止最对齐的模型,与Fable 5一样不易被诱骗滥用。公司故意未在网络安全任务上训练该模型,但Opus 5在发现开源代码漏洞方面仍接近Mythos 5,而在实际利用漏洞方面则远远落后——这正是Anthropic所期望的。Opus 5配备了一套安全分类器,用于筛选涉及漏洞生成和渗透测试等狭窄范围的网络任务。这些分类器的范围比Fable 5的更窄,Anthropic预计其干预频率将降低约85%。当分类器标记请求时,默认回退到Opus 4.8,API用户可启用相同行为。企业和Anthropic网络验证计划的研究人员可获得限制较少的Opus 5版本。
Anthropic还推出了“快速模式”,可将输出代币生成速度提高2.5倍,但成本增加2倍。此外,还推出了自动回退功能,允许被安全分类器拒绝的请求自动路由到其他模型,以及上下文工具切换功能,可在不使提示缓存失效的情况下更改Claude可用的工具。Opus 5现已面向所有Anthropic付费计划及Claude平台提供,模型名为claude-opus-5。