AI News HubLIVE
站内改写2 分钟阅读

Claude Opus 5 发布

Anthropic 推出 Claude Opus 5,一款在编码和知识工作方面达到新高度的高效模型,价格仅为 Claude Fable 5 的一半。它在多个基准测试中表现优异,尤其擅长软件工程、科学研究和视觉输出。Opus 5 具备更强的自我验证和迭代能力,早期用户反馈积极。尽管在网络安全方面仍落后于 Mythos 5,但其对齐性和安全性达到了最高水平。

Anthropic 于 2026 年 7 月 24 日正式发布 Claude Opus 5。这款新模型被描述为“深思熟虑且主动”,在智能水平上接近旗舰模型 Claude Fable 5,但价格仅为后者的一半。Opus 5 旨在成为日常使用的默认模型,现已作为 Claude Max 的默认选项,同时也是 Claude Pro 上最强大的模型。

在性能与成本效益方面,Opus 5 相比前代 Opus 4.8 实现了显著提升,而成本保持不变。用户可以通过调整模型的“努力程度”设置来优化智能水平或节省 token,以获得更快的响应和更低成本。在软件工程任务中,Opus 5 表现尤为突出:在 Frontier-Bench v0.1 上,它超越了所有其他模型,每任务成本更低,性能是 Opus 4.8 的两倍以上;在 CursorBench 3.2 上,最大努力下其得分与 Fable 5 相差不到 0.5%,但成本仅为后者的一半。在知识工作和问题解决方面,Opus 5 同样表现出色:在 ARC-AGI 3 测试中,其得分是次优模型的三倍;在 Zapier AutomationBench 上,其通过率约为次优模型的 1.5 倍,即使在最低努力设置下,通过的任务数也超过其他任何模型;在计算机使用基准 OSWorld 2.0 上,Opus 5 以低于 Fable 5 三分之一的成本实现了更好的结果。

在科学研究领域,Opus 5 相比 Opus 4.8 有显著改进,尤其在生命科学评估中全面领先。例如,在从光谱数据推断分子结构的内部基准测试中,其得分高出 10.2 个百分点;在预测蛋白质序列变异影响的任务中,得分高出 7.7 个百分点。此外,Opus 5 的视觉输出能力也大幅提升,能够生成空气动力学流动可视化、细胞交互式插图等高质量内容。

Opus 5 的一大亮点是其强大的自我验证和迭代能力。在 Frontier-Bench 任务中,模型被要求根据无法直接查看的机械零件图纸重建 3D 模型,它自行编写计算机视觉管线从原始像素中提取几何信息,并成功完成任务,而其他模型在五次尝试后仍无法解决。在修复流行开源包管理器中的真实漏洞时,Opus 5 不仅找到了根因,还修复了社区补丁遗漏的边界情况,而竞争模型仅修复了表面症状。早期用户反馈也证实了其卓越性能:一家交易公司的工程师使用 Opus 5 在一个会话中构建了新交易所的市场数据订阅,而此前模型即使有详细计划也无法完成;Opus 5 甚至在没有实时数据源验证的情况下,自行构建了测试工具来确保代码正确解析数据。

多家合作伙伴对 Opus 5 给予了高度评价。Devin 发现其在 FrontierCode 1.1 上以一半成本接近 Fable 性能;Cursor 报告其在 CursorBench 上接近 Fable 5,并展现出类似行为;Zapier 自动化基准中,Opus 5 以 100% 的通过率位居榜首,成功完成从识别风险账户到生成留存运营摘要的完整流程;在基因组学分析中,模型表现出科学家的谨慎态度,主动选择正确的统计测试排除混杂因素,并通过独立方法交叉验证结果。Lovable 指出 Opus 5 是 Opus 系列自 4.5 以来最大的飞跃,在前端动画、游戏和 3D 工作方面表现最佳。

在对齐与安全方面,Claude Opus 5 在预部署测试中被评为迄今为止最对齐的模型,其道德遵循程度优于 Opus 4.8、Sonnet 5 和 Fable 5,欺骗行为率最低,且不易被诱导滥用。在安全评估中,Opus 5 未在危险的通用能力方面取得进展,在生物学研究和进攻性网络安全方面仍落后于 Mythos 5。由于 Anthropic 有意避免在网络安全任务上训练 Opus 5,尽管模型因通用能力提升而在查找漏洞方面接近 Mythos 5,但在利用漏洞方面仍存在显著差距。完整的系统安全卡片提供了更多细节。