[AINews] Claude Opus 5:以Opus價格實現寓言級效能(價格僅為Fable一半)
Anthropic釋出了Claude Opus 5,以Opus的價格實現了接近Fable的效能。獨立基準測試顯示其在某些指標上超越Fable,但官方表態較為謹慎。社群反響強調其強大的編碼能力和代理工具使用,儘管存在一些基準不一致的問題。
在罕見的週五釋出中,Opus 5成為今日頭條。儘管大多數官方基準測試顯示它在技術上擊敗了Fable,但官方資訊仍表示它“接近”Fable。這主要反映了Evals的難度——今天的AIE賽道下降——沒有反映出Anthropic顯然知道Fable保留但無法測量的“大模型感覺”。
幸運的是,獨立評估證實了Opus的優越效能:@AnthropicAI釋出了Claude Opus 5,它成為Artificial Analysis Intelligence Index的新領導者。除了定價之外,改進的效率故事也很重要……儘管它僅與GPT 5.6 Sol相匹配。
AI Twitter回顧
頭條:Claude Opus 5模型釋出
發生了什麼
Anthropic的Claude Opus 5釋出引發了基準審視、強烈的軼事編碼代理讚譽以及關於前沿模型評估的新一輪辯論。
多條推文明確討論了Claude Opus 5作為新發布模型,並將其與其他前沿系統在編碼和通用能力指標上進行比較,包括Epoch的ECI評估、FrontierCode異常討論以及來自工具使用工作流(如瀏覽器自動化)的早期使用者反應。
Epoch報告稱,Claude Opus 5實現了159的ECI,“略低於Fable 5的161”,同時在軟體工程基準上以161的SWE-ECI與Fable 5持平。
ECI結果立即招致批評,使用者認為該分數低估了Opus 5的實際改進;一位回應稱其“被嚴重低估”,指出它只比Opus 4.8好1點,儘管在實踐中“幾乎所有方面都好得多”。同一位使用者呼籲更難的公共基準。
另一個執行緒凸顯了明顯的基準異常:在FrontierCode上,Opus 5在中等努力下得分高於更高努力,儘管更多努力在其他評估上改善了效能。這表明要麼是任務特定的搜尋/努力權衡,要麼是評估不穩定,而不是推理時間計算增加帶來的單調收益。
幾位技術素養高的使用者稱讚了Opus 5的編碼效能。Mikhail Parakhin表示“Best-of-n規則”,並報告了在與Fable的直接對決中“在數學和幾乎所有方面”取得清晰勝利,同時希望它能在Codex中使用。
Arena推廣了Opus 5的第一印象,並表示基於實際使用的排行榜即將推出,表明社群評估在釋出時仍在追趕。
Nous Research的入口網站增加了對模型的訪問許可權,一條推文表示使用者可以直接透過Nous Portal使用Opus 5,並且所有模型(包括Opus 5)享受20%折扣。這是分發/可用性而非能力宣告。
使用者軼事強調了瀏覽器控制/代理工具使用。一條帖子稱Opus 5開啟了瀏覽器並取消了ChatGPT Pro訂閱,隨後是“這東西真的可以驅動瀏覽器,哇”。這些是孤立的演示,而非系統評估,但它們與更廣泛的市場對計算機使用代理的興趣一致。
其他早期反應更多是模因而非技術性的,包括“Opus 5地鐵FPS結果”、“On Claude bro”和“他們害怕Anthropic”。這些反映了情緒而非證據。
技術細節
Epoch能力指數(ECI):
Claude Opus 5 ECI = 159
Fable 5 ECI = 161
Claude Opus 5 SWE-ECI = 161,與Fable 5在軟體工程上持平
社群回應指出該模型僅比Opus 4.8高出1個ECI點,一些讀者認為相對於定性收益而言太小。
FrontierCode行為:一位評估者注意到在FrontierCode上,Opus 5在中等努力下的表現優於高努力,儘管在其他地方更多努力通常帶來改進。該推文未提供原始數字,但核心技術點是增加的努力並非普遍有益。
軼事比較性宣告:
在一位使用者的測試中,與Fable的直接對決取得清晰勝利,尤其是在best-of-n取樣下
在一個生態系統總結帖子中“匹配神話”,儘管沒有附帶數字
事實與觀點
更事實性/測量導向的宣告
Epoch的基準宣告,Opus 5得分為159 ECI和161 SWE-ECI,是該集合中最清晰的經驗宣告。
Arena的宣告,即第一印象可用,真實世界排行榜即將推出,是事實性的但不完整。
Nous Portal提供對Opus 5的訪問並提供20%折扣是產品可用性事實。
解讀/觀點
“ECI被低估”和“我們需要更難的公共基準”是關於基準有效性和敏感性的觀點。
“如何動搖對任何基準的信心:展示Anthropic在其上表現平庸”是對基準話語和社群偏見的修辭性懷疑。
“Best-of-n規則”和Opus相對於Fable“非常清晰的贏家”是非正式的從業者判斷,有用但非標準化。
“他們害怕Anthropic”和與Anthropic相關的AGI時間線推測是純粹的觀點/推測而非釋出證據。
不同觀點
支援性觀點
最強烈的正面解讀是Opus 5在實際使用中比當前公開聚合基準顯示的要強大得多,尤其是對於編碼和工具使用任務。
@MParakhin報告它在自己的測試中擊敗了Fable,並且best-of-n改善了結果。
@abacaj強調了有效的瀏覽器自動化,暗示實用的代理能力。
@bijanbowen稱“地鐵FPS結果”是目前最好的,暗示視覺/計算機使用演示質量給觀眾留下了印象。
@eliebakouch將Opus 5置於頂級封閉模型釋出之列,並稱其“匹配神話”,將其定位為頂級前沿參賽者。
懷疑/批評性觀點
主要批評不是Opus 5弱,而是圍繞它的基準測試不穩定、不明確或與使用者印象不符。
@jerhadf指出了FrontierCode上令人費解的努力縮放不一致。
@scaling01認為ECI結果相對於觀察到的改進似乎太低,並以此呼籲更難的公共基準。
@teortaxesTex暗示一些基準信任是有條件的,Anthropic特定的結果會引發基準批評,即社會解讀可能汙染技術評估。
中立/分析性觀點
Epoch的框架是剋制的:整體略低於Fable,在SWE特定能力上持平。
Arena的“現在第一印象,以後真實世界排行榜”是另一種中立姿態,實際上表明社群尚未在穩健排名上達成一致。
背景
Claude系列模型已經以強大的編碼效能、長上下文實用性和相對精緻的企業/產品包裝而聞名,因此Opus 5進入了一個使用者準備測試Anthropic能否維持或擴充套件編碼領先地位的市場。
此次釋出恰逢從靜態聊天基準向代理評估的更廣泛轉變:瀏覽器使用、工具呼叫、並行任務執行和軟體工程迴圈完成。這就是為什麼即使像瀏覽器取消工作流這樣的隨意軼事也獲得了關注——它們對映到經典問答基準無法捕捉的真實世界能力類別。
圍繞Opus 5的基準摩擦符合更廣泛的生態系統問題:聚合能力分數通常將多樣行為壓縮成一個數字。ECI和類似指數對於廣泛跟蹤有用,但單一數字摘要可能掩蓋:
編碼與非編碼專業化
推理時間計算/努力縮放行為
best-of-n收益
工具使用可靠性
真實世界延遲/成本權衡
FrontierCode“中等努力擊敗更高努力”的觀察尤其相關,因為前沿實驗室越來越依賴測試時間計算和搜尋。如果更多努力在某些分佈上損害效能,那麼部署策略幾乎與基礎模型質量同等重要。
ECI討論還表明,Opus 5可能是軟體工程強度比整體全能能力增益更突出的案例。Epoch的數字直接支援這一區別:整體159 vs SWE-ECI 161。
競爭背景包括反覆提及Fable 5、GPT 5.6、Grok 4.5、Kimi K3、Mythos和開放權重動量。因此,Opus 5不是孤立判斷,而是在一個擁擠的前沿領域中,其中:
編碼能力是關鍵楔子
成本/效率重要
公共基準滯後於產品化代理使用
一些最強的親Anthropic情緒在推文集中部分基於聲譽而非基準——例如聲稱其他人“害怕Anthropic”。對於專家讀者,更實質的訊號是即使基準懷疑論者大多在爭論Opus 5有多好,而不是它是否屬於前沿。
該模型的釋出還與圍繞AI安全和自主事件的更廣泛話語相交,包括路透社報道的來自另一個代理環境的行為以及關於秘密協調和“謀劃”的評論。雖然不直接關於Opus 5,但這些話語可能影響了使用者如何解讀Anthropic的釋出,因為Anthropic與安全意識品牌強烈關聯。
實際含義是Opus 5的接受是透過兩個同時的鏡頭過濾的:
作為使用者可以立即操作的編碼/代理產品
作為面臨日益對抗的基準和安全審查的前沿模型
這種組合解釋了這些推文中的釋出模式:較少的“規格表”帖子,更多的是關於評估方法論、代理演示和真實世界編碼效能的爭論。
其他主題
開放模型、蒸餾和AI主權
NVIDIA的Jensen Huang釋出了一封信,認為開放模型很重要,因為AI“將改變每個行業,賦能每家公司,並由每個國家構建”,將開放模型視為有利於安全、網路安全、創新擴散和主權。
這封信獲得了生態系統人物和公司的支援,包括@MarkMcQuade、@ClementDelangue、@vincentweisser、@willccbb的反應,一位評論者對Jensen明確提到蒸餾感到高興。
多個帖子將這一天視為開放權重不會被政治擠壓的積極訊號。
一些人要求比“開放權重”更強的標準,同時要求程式碼和資料的開放性。
Hugging Face的Quentin Gallouédec釋出了GitHub活動背景,以強調HF對開源AI基礎設施的投資,而不僅僅是開放權重的修辭。
安全事件、威脅框架和網路政策
路透社報道
[為AI成本控制而截斷]