认识全新的Claude Opus 5:以不变的Opus价格提供前沿级别的代理编码和计算机使用
Anthropic发布了Claude Opus 5,取代Opus 4.8成为Opus系列旗舰模型。定价不变(输入每百万token5美元,输出25美元),性能接近Claude Fable 5的一半价格。主要变化包括思考功能默认开启、API破坏性变更、以及删除验证提示。在代理编码和计算机使用基准测试中表现卓越,尤其是在OSWorld和Zapier AutomationBench上。安全方面,仅放宽了源代码漏洞查找的限制,而利用路径仍被阻止。
Anthropic于今日正式发布Claude Opus 5,这款新模型取代了Opus 4.8成为Opus系列的旗舰产品。定价保持原有水平,即每百万输入token收费5美元,每百万输出token收费25美元。据Anthropic团队介绍,Opus 5在智能程度上已接近Claude Fable 5,但价格仅为后者的一半。目前,Opus 5已成为Claude Max的默认模型,同时也是Claude Pro中最强大的选项。
在API层面,Opus 5带来了三项重要变化。首先,思考(Thinking)功能默认开启,而在Opus 4.8上,除非明确设置thinking: {type: "adaptive"},否则请求不会触发思考。Opus 5则会自动进行思考,并通过effort参数控制深度。由于max_tokens上限同时包含思考过程和回复文本,开发者需重新评估现有设置。其次,这是一个破坏性变更:将thinking设为{type: "disabled"}并配合xhigh或max的努力级别将返回400错误。该限制在每个请求上强制执行,开发者要么将努力限制在high,要么完全移除thinking字段。最后,Anthropic建议开发者删除验证提示(verification prompts),例如“包含最终验证步骤”这类指令可能导致过度验证,因为模型本身已具备自我验证能力。Opus 5的提示指南详细介绍了调优模式。
模型ID为claude-opus-5,上下文窗口默认和最大值均为100万token,无更小版本。同步Messages API的最大输出为128k token,而Messages Batches API通过添加output-300k-2026-03-24 beta头可实现300k token输出。此外,最小可缓存提示降至512 token,相比此前的1024 token有所减少。
在编码和代理能力方面,Opus 5取得了显著进步。在替代Terminal-Bench 2.1的74项任务基准FrontierBench v0.1上,Opus 5在最大努力下得分为43.3%,远高于Opus 4.8的18.7%,同时也超过了Fable 5(33.7%)和GPT-5.6 Sol(37.5%)。在xhigh努力下,Opus 5达到了44.4%的最佳平均奖励。值得注意的是,测试中Opus 5的安全分类器标记并拒绝了5%的API调用,涉及4%的试验,而Fable 5的这一比例高达42%和26%。
在SWE-bench Verified上,Opus 5得分96.0%,在SWE-bench Pro上为79.2%,略低于Fable 5的80.0%。SWE-bench Multimodal的提升更为显著,从38.4%跃升至59.4%。代理任务是最明显的强项:OSWorld 2.0上Opus 5达到70.57%,而Opus 4.8为55.7%;Zapier AutomationBench上得分为26.0%,高于Opus 4.8的17.0%和Fable 5的17.4%。即使在中等努力下,它也能以每任务0.89美元的成本获得24%的得分。
在推理方面,Anthropic让Opus 5在没有工具或代理框架的情况下解答了所有六道IMO 2026问题。由三个模型组成的评审小组判定所有24个生成的解答正确,人类专家对每道题预选的一个解答评分均为7/7,最终总分42/42达到了金牌水平,远超29/42的分数线。在ARC-AGI-3上,ARC Prize基金会验证了Opus 5在高努力下30.16%的得分,大约是此前最佳排行榜得分的四倍(GPT-5.6 Sol为7.78%,Opus 4.8为1.52%)。在“人类最后的考试”中,Opus 5无需工具得分为56.3%,使用工具后升至64.7%。
多模态任务中,工具的使用比单纯的思考更有效。在Chartography上,无工具时Opus 5得分为29.6%,但配合容器和图像裁剪工具后升至83.0%。在BenchCAD Vision2Code上,体素IoU从0.366提升至0.821,超过Claude Mythos 5的0.678。
网络安全能力也随之提升,尽管Anthropic并未专门针对网络安全任务训练Opus 5。在ExploitBench的AutoNudge分支中,Opus 5获得了10.14的平均能力标志,生成了99个完整的任意代码执行漏洞利用,而Mythos 5为132个。在OSS-Fuzz上,Opus 5在79.4%的目标上获得非零分数,与Mythos 5的80%接近,但Opus 5完成了4个完整利用,而Mythos 5为13个。这一差距体现了安全设计原则:Opus 5在发现漏洞方面几乎与Mythos 5一样强大,但在利用方面明显落后。因此,Anthropic仅开放了源代码漏洞查找,二进制扫描、渗透测试和漏洞利用生成仍被禁止。分类器的干预频率预计比Fable 5低约85%。英国AISI的测试显示,Opus 5在“The Last Ones”任务中10次尝试有8次成功完成,在更难的“Doing Life”任务中达到了第22步(共23步),优于任何先前测试的模型。
在间接提示注入方面,Opus 5表现出色。在Gray Swan基准测试中,15次尝试内的攻击成功率从Opus 4.8的5.5%降至2.0%,而Mythos 5为2.6%,GPT-5.6 Sol高达20.0%。在Claude Cowork浏览器环境中,攻击成功率从31.5%降至3.70%(无安全措施),启用自动模式后在全部129个环境中降为0%。
总体而言,Claude Opus 5在保持定价不变的同时,在代理编码、推理和安全方面实现了跨越式进步。社区反馈积极,尽管Anthropic也坦承模型在事实性幻觉方面略高于Opus 4.8。这款模型现已通过Claude API和各个平台提供。