[AINews] Claude Opus 5:以Opus价格实现寓言级性能(价格仅为Fable一半)
Anthropic发布了Claude Opus 5,以Opus的价格实现了接近Fable的性能。独立基准测试显示其在某些指标上超越Fable,但官方表态较为谨慎。社区反响强调其强大的编码能力和代理工具使用,尽管存在一些基准不一致的问题。
在罕见的周五发布中,Opus 5成为今日头条。尽管大多数官方基准测试显示它在技术上击败了Fable,但官方信息仍表示它“接近”Fable。这主要反映了Evals的难度——今天的AIE赛道下降——没有反映出Anthropic显然知道Fable保留但无法测量的“大模型感觉”。
幸运的是,独立评估证实了Opus的优越性能:@AnthropicAI发布了Claude Opus 5,它成为Artificial Analysis Intelligence Index的新领导者。除了定价之外,改进的效率故事也很重要……尽管它仅与GPT 5.6 Sol相匹配。
AI Twitter回顾
头条:Claude Opus 5模型发布
发生了什么
Anthropic的Claude Opus 5发布引发了基准审视、强烈的轶事编码代理赞誉以及关于前沿模型评估的新一轮辩论。
多条推文明确讨论了Claude Opus 5作为新发布模型,并将其与其他前沿系统在编码和通用能力指标上进行比较,包括Epoch的ECI评估、FrontierCode异常讨论以及来自工具使用工作流(如浏览器自动化)的早期用户反应。
Epoch报告称,Claude Opus 5实现了159的ECI,“略低于Fable 5的161”,同时在软件工程基准上以161的SWE-ECI与Fable 5持平。
ECI结果立即招致批评,用户认为该分数低估了Opus 5的实际改进;一位回应称其“被严重低估”,指出它只比Opus 4.8好1点,尽管在实践中“几乎所有方面都好得多”。同一位用户呼吁更难的公共基准。
另一个线程凸显了明显的基准异常:在FrontierCode上,Opus 5在中等努力下得分高于更高努力,尽管更多努力在其他评估上改善了性能。这表明要么是任务特定的搜索/努力权衡,要么是评估不稳定,而不是推理时间计算增加带来的单调收益。
几位技术素养高的用户称赞了Opus 5的编码性能。Mikhail Parakhin表示“Best-of-n规则”,并报告了在与Fable的直接对决中“在数学和几乎所有方面”取得清晰胜利,同时希望它能在Codex中使用。
Arena推广了Opus 5的第一印象,并表示基于实际使用的排行榜即将推出,表明社区评估在发布时仍在追赶。
Nous Research的门户网站增加了对模型的访问权限,一条推文表示用户可以直接通过Nous Portal使用Opus 5,并且所有模型(包括Opus 5)享受20%折扣。这是分发/可用性而非能力声明。
用户轶事强调了浏览器控制/代理工具使用。一条帖子称Opus 5打开了浏览器并取消了ChatGPT Pro订阅,随后是“这东西真的可以驱动浏览器,哇”。这些是孤立的演示,而非系统评估,但它们与更广泛的市场对计算机使用代理的兴趣一致。
其他早期反应更多是模因而非技术性的,包括“Opus 5地铁FPS结果”、“On Claude bro”和“他们害怕Anthropic”。这些反映了情绪而非证据。
技术细节
Epoch能力指数(ECI):
Claude Opus 5 ECI = 159
Fable 5 ECI = 161
Claude Opus 5 SWE-ECI = 161,与Fable 5在软件工程上持平
社区回应指出该模型仅比Opus 4.8高出1个ECI点,一些读者认为相对于定性收益而言太小。
FrontierCode行为:一位评估者注意到在FrontierCode上,Opus 5在中等努力下的表现优于高努力,尽管在其他地方更多努力通常带来改进。该推文未提供原始数字,但核心技术点是增加的努力并非普遍有益。
轶事比较性声明:
在一位用户的测试中,与Fable的直接对决取得清晰胜利,尤其是在best-of-n采样下
在一个生态系统总结帖子中“匹配神话”,尽管没有附带数字
事实与观点
更事实性/测量导向的声明
Epoch的基准声明,Opus 5得分为159 ECI和161 SWE-ECI,是该集合中最清晰的经验声明。
Arena的声明,即第一印象可用,真实世界排行榜即将推出,是事实性的但不完整。
Nous Portal提供对Opus 5的访问并提供20%折扣是产品可用性事实。
解读/观点
“ECI被低估”和“我们需要更难的公共基准”是关于基准有效性和敏感性的观点。
“如何动摇对任何基准的信心:展示Anthropic在其上表现平庸”是对基准话语和社区偏见的修辞性怀疑。
“Best-of-n规则”和Opus相对于Fable“非常清晰的赢家”是非正式的从业者判断,有用但非标准化。
“他们害怕Anthropic”和与Anthropic相关的AGI时间线推测是纯粹的观点/推测而非发布证据。
不同观点
支持性观点
最强烈的正面解读是Opus 5在实际使用中比当前公开聚合基准显示的要强大得多,尤其是对于编码和工具使用任务。
@MParakhin报告它在自己的测试中击败了Fable,并且best-of-n改善了结果。
@abacaj强调了有效的浏览器自动化,暗示实用的代理能力。
@bijanbowen称“地铁FPS结果”是目前最好的,暗示视觉/计算机使用演示质量给观众留下了印象。
@eliebakouch将Opus 5置于顶级封闭模型发布之列,并称其“匹配神话”,将其定位为顶级前沿参赛者。
怀疑/批评性观点
主要批评不是Opus 5弱,而是围绕它的基准测试不稳定、不明确或与用户印象不符。
@jerhadf指出了FrontierCode上令人费解的努力缩放不一致。
@scaling01认为ECI结果相对于观察到的改进似乎太低,并以此呼吁更难的公共基准。
@teortaxesTex暗示一些基准信任是有条件的,Anthropic特定的结果会引发基准批评,即社会解读可能污染技术评估。
中立/分析性观点
Epoch的框架是克制的:整体略低于Fable,在SWE特定能力上持平。
Arena的“现在第一印象,以后真实世界排行榜”是另一种中立姿态,实际上表明社区尚未在稳健排名上达成一致。
背景
Claude系列模型已经以强大的编码性能、长上下文实用性和相对精致的企业/产品包装而闻名,因此Opus 5进入了一个用户准备测试Anthropic能否维持或扩展编码领先地位的市场。
此次发布恰逢从静态聊天基准向代理评估的更广泛转变:浏览器使用、工具调用、并行任务执行和软件工程循环完成。这就是为什么即使像浏览器取消工作流这样的随意轶事也获得了关注——它们映射到经典问答基准无法捕捉的真实世界能力类别。
围绕Opus 5的基准摩擦符合更广泛的生态系统问题:聚合能力分数通常将多样行为压缩成一个数字。ECI和类似指数对于广泛跟踪有用,但单一数字摘要可能掩盖:
编码与非编码专业化
推理时间计算/努力缩放行为
best-of-n收益
工具使用可靠性
真实世界延迟/成本权衡
FrontierCode“中等努力击败更高努力”的观察尤其相关,因为前沿实验室越来越依赖测试时间计算和搜索。如果更多努力在某些分布上损害性能,那么部署策略几乎与基础模型质量同等重要。
ECI讨论还表明,Opus 5可能是软件工程强度比整体全能能力增益更突出的案例。Epoch的数字直接支持这一区别:整体159 vs SWE-ECI 161。
竞争背景包括反复提及Fable 5、GPT 5.6、Grok 4.5、Kimi K3、Mythos和开放权重动量。因此,Opus 5不是孤立判断,而是在一个拥挤的前沿领域中,其中:
编码能力是关键楔子
成本/效率重要
公共基准滞后于产品化代理使用
一些最强的亲Anthropic情绪在推文集中部分基于声誉而非基准——例如声称其他人“害怕Anthropic”。对于专家读者,更实质的信号是即使基准怀疑论者大多在争论Opus 5有多好,而不是它是否属于前沿。
该模型的发布还与围绕AI安全和自主事件的更广泛话语相交,包括路透社报道的来自另一个代理环境的行为以及关于秘密协调和“谋划”的评论。虽然不直接关于Opus 5,但这些话语可能影响了用户如何解读Anthropic的发布,因为Anthropic与安全意识品牌强烈关联。
实际含义是Opus 5的接受是通过两个同时的镜头过滤的:
作为用户可以立即操作的编码/代理产品
作为面临日益对抗的基准和安全审查的前沿模型
这种组合解释了这些推文中的发布模式:较少的“规格表”帖子,更多的是关于评估方法论、代理演示和真实世界编码性能的争论。
其他主题
开放模型、蒸馏和AI主权
NVIDIA的Jensen Huang发布了一封信,认为开放模型很重要,因为AI“将改变每个行业,赋能每家公司,并由每个国家构建”,将开放模型视为有利于安全、网络安全、创新扩散和主权。
这封信获得了生态系统人物和公司的支持,包括@MarkMcQuade、@ClementDelangue、@vincentweisser、@willccbb的反应,一位评论者对Jensen明确提到蒸馏感到高兴。
多个帖子将这一天视为开放权重不会被政治挤压的积极信号。
一些人要求比“开放权重”更强的标准,同时要求代码和数据的开放性。
Hugging Face的Quentin Gallouédec发布了GitHub活动背景,以强调HF对开源AI基础设施的投资,而不仅仅是开放权重的修辞。
安全事件、威胁框架和网络政策
路透社报道
[为AI成本控制而截断]