Opus 5价格仅为三分之一——而这恰恰是问题所在
Anthropic的Opus 5比Fable 5更便宜、限制更少,在代理编程任务中以较低成本表现出色。然而,其自主性给团队带来了安全性和成本管理挑战。
上周五,Anthropic发布了其重量级模型的最新迭代版本Opus 5。距离Opus 4.8仅两个月,继6月发布的Mythos 5、Fable 5和Sonnet 5之后,Opus 5补全了新一代模型阵容——仅剩轻量级Haiku等待升级。
虽然比旗舰模型Fable 5更小,但Opus 5的价格显著更低,限制也明显更少。Opus 5旨在无需频繁人工干预的情况下,长时间处理编程任务。
定价为每百万输入代币5美元、每百万输出代币25美元,Opus 5颠覆了代理型任务的性价比。在Frontier-Bench和GDPval-AA等编程和知识工作评估中,Opus 5达到了新的最先进水平。在OSWorld 2.0计算机使用基准测试中,它以不到Fable 5最佳结果三分之一的成本超越了所有其他模型。在ARC-AGI 3(一种需解决新问题的评估)中,其得分是次优模型的三倍。
由于运行成本更低,团队可以负担让Opus 5处理更大规模的编程任务。这也意味着需要重新考虑安全性。Anthropic在公告中写道,Opus 5“在验证其工作并仔细迭代直至成功方面强得多”。在基准测试中,模型被给予不完整的提示,并被故意阻止查看机器零件的图纸。模型并未放弃,而是编写了自己的计算机视觉管线,从图像数据中重建了零件。
当模型在多个系统中无需持续人工监督而工作时,访问权限必须是临时的且易于撤销。这就是为什么短期即时凭据正受到更多关注,类似于1Password正在为Claude开发的委托认证模型。给AI赋予不懈的持久性有一个问题:它不知道何时停止。标准的API日志无法及时标记这种行为。团队需要构建更智能的遥测系统,真正理解工作流程的上下文。你需要一个语义断路器,在模型烧完你的计算预算之前拔掉插头。
Opus 5降低了每个代币的价格标签,但自主编码仍可能迅速变得昂贵。一个代理在后台循环工作数小时,在移交PR之前会消耗数百万代币。对于平台团队而言,按会话管理支出成为新的运营要求。为了保持这些后台作业不会因边缘情况而崩溃,Anthropic正在推出自动回退功能测试版。如果提示触发了Opus 5的安全分类器,API会静默地将任务路由到Opus 4.8,而不是抛出硬错误并终止整个管线。
Opus 5还继承了其前身的零保留策略,绕过了Fable和Mythos所需的30天数据记录。为了理解Anthropic期望这些环境工具在何处运行,有必要看看他们如何人为地限制模型。该公司正在短期能力与长期安全之间谨慎权衡。
Anthropic发言人告诉The New Stack,与Opus 4.8相比,Opus 5在生物学任务上有“有意义的改进”,使其成为“科学研究中我们最强大的通用可用模型”。在内部有机化学基准测试(如从光谱数据推断分子结构)中,得分高出10.2个百分点;在预测蛋白质序列变异如何决定功能方面,得分高出7.7个百分点。然而,Anthropic的测试揭示了“长期自主研究任务的显著局限性”,他们认为这带来了最高的潜在风险。因此,Opus 5保留了与Opus 4.8类似的生物安全措施组合。虽然Fable 5上被阻止的生物学相关请求现在将路由到Opus 5而非4.8,但不受限制的Mythos 5对于长期、开放式工作(如自主药物设计活动)仍是更强的模型。
Opus 5可以审查源代码进行防御性安全工作。Anthropic表示,这些安全措施的激活频率应远低于Fable 5——根据公司说法,降低约85%。显然,模型正在快速改进,但现在更大的挑战是确保它们运行所在的平台能够跟上步伐。