AI News HubLIVE
站內改寫5 分鐘閱讀

[AINews] Claude Opus 5:以Opus價格實現寓言級性能(價格僅為Fable一半)

Anthropic發佈了Claude Opus 5,以Opus的價格實現了接近Fable的性能。獨立基準測試顯示其在某些指標上超越Fable,但官方表態較為謹慎。社區反響強調其強大的編碼能力和代理工具使用,儘管存在一些基準不一致的問題。

在罕見的週五發佈中,Opus 5成為今日頭條。儘管大多數官方基準測試顯示它在技術上擊敗了Fable,但官方信息仍表示它“接近”Fable。這主要反映了Evals的難度——今天的AIE賽道下降——沒有反映出Anthropic顯然知道Fable保留但無法測量的“大模型感覺”。

幸運的是,獨立評估證實了Opus的優越性能:@AnthropicAI發佈了Claude Opus 5,它成為Artificial Analysis Intelligence Index的新領導者。除了定價之外,改進的效率故事也很重要……儘管它僅與GPT 5.6 Sol相匹配。

AI Twitter回顧

頭條:Claude Opus 5模型發佈

發生了什麼

Anthropic的Claude Opus 5發佈引發了基準審視、強烈的軼事編碼代理讚譽以及關於前沿模型評估的新一輪辯論。

多條推文明確討論了Claude Opus 5作為新發布模型,並將其與其他前沿系統在編碼和通用能力指標上進行比較,包括Epoch的ECI評估、FrontierCode異常討論以及來自工具使用工作流(如瀏覽器自動化)的早期用户反應。

Epoch報告稱,Claude Opus 5實現了159的ECI,“略低於Fable 5的161”,同時在軟件工程基準上以161的SWE-ECI與Fable 5持平。

ECI結果立即招致批評,用户認為該分數低估了Opus 5的實際改進;一位回應稱其“被嚴重低估”,指出它只比Opus 4.8好1點,儘管在實踐中“幾乎所有方面都好得多”。同一位用户呼籲更難的公共基準。

另一個線程凸顯了明顯的基準異常:在FrontierCode上,Opus 5在中等努力下得分高於更高努力,儘管更多努力在其他評估上改善了性能。這表明要麼是任務特定的搜索/努力權衡,要麼是評估不穩定,而不是推理時間計算增加帶來的單調收益。

幾位技術素養高的用户稱讚了Opus 5的編碼性能。Mikhail Parakhin表示“Best-of-n規則”,並報告了在與Fable的直接對決中“在數學和幾乎所有方面”取得清晰勝利,同時希望它能在Codex中使用。

Arena推廣了Opus 5的第一印象,並表示基於實際使用的排行榜即將推出,表明社區評估在發佈時仍在追趕。

Nous Research的門户網站增加了對模型的訪問權限,一條推文表示用户可以直接通過Nous Portal使用Opus 5,並且所有模型(包括Opus 5)享受20%折扣。這是分發/可用性而非能力聲明。

用户軼事強調了瀏覽器控制/代理工具使用。一條帖子稱Opus 5打開了瀏覽器並取消了ChatGPT Pro訂閲,隨後是“這東西真的可以驅動瀏覽器,哇”。這些是孤立的演示,而非系統評估,但它們與更廣泛的市場對計算機使用代理的興趣一致。

其他早期反應更多是模因而非技術性的,包括“Opus 5地鐵FPS結果”、“On Claude bro”和“他們害怕Anthropic”。這些反映了情緒而非證據。

技術細節

Epoch能力指數(ECI):

Claude Opus 5 ECI = 159

Fable 5 ECI = 161

Claude Opus 5 SWE-ECI = 161,與Fable 5在軟件工程上持平

社區回應指出該模型僅比Opus 4.8高出1個ECI點,一些讀者認為相對於定性收益而言太小。

FrontierCode行為:一位評估者注意到在FrontierCode上,Opus 5在中等努力下的表現優於高努力,儘管在其他地方更多努力通常帶來改進。該推文未提供原始數字,但核心技術點是增加的努力並非普遍有益。

軼事比較性聲明:

在一位用户的測試中,與Fable的直接對決取得清晰勝利,尤其是在best-of-n採樣下

在一個生態系統總結帖子中“匹配神話”,儘管沒有附帶數字

事實與觀點

更事實性/測量導向的聲明

Epoch的基準聲明,Opus 5得分為159 ECI和161 SWE-ECI,是該集合中最清晰的經驗聲明。

Arena的聲明,即第一印象可用,真實世界排行榜即將推出,是事實性的但不完整。

Nous Portal提供對Opus 5的訪問並提供20%折扣是產品可用性事實。

解讀/觀點

“ECI被低估”和“我們需要更難的公共基準”是關於基準有效性和敏感性的觀點。

“如何動搖對任何基準的信心:展示Anthropic在其上表現平庸”是對基準話語和社區偏見的修辭性懷疑。

“Best-of-n規則”和Opus相對於Fable“非常清晰的贏家”是非正式的從業者判斷,有用但非標準化。

“他們害怕Anthropic”和與Anthropic相關的AGI時間線推測是純粹的觀點/推測而非發佈證據。

不同觀點

支持性觀點

最強烈的正面解讀是Opus 5在實際使用中比當前公開聚合基準顯示的要強大得多,尤其是對於編碼和工具使用任務。

@MParakhin報告它在自己的測試中擊敗了Fable,並且best-of-n改善了結果。

@abacaj強調了有效的瀏覽器自動化,暗示實用的代理能力。

@bijanbowen稱“地鐵FPS結果”是目前最好的,暗示視覺/計算機使用演示質量給觀眾留下了印象。

@eliebakouch將Opus 5置於頂級封閉模型發佈之列,並稱其“匹配神話”,將其定位為頂級前沿參賽者。

懷疑/批評性觀點

主要批評不是Opus 5弱,而是圍繞它的基準測試不穩定、不明確或與用户印象不符。

@jerhadf指出了FrontierCode上令人費解的努力縮放不一致。

@scaling01認為ECI結果相對於觀察到的改進似乎太低,並以此呼籲更難的公共基準。

@teortaxesTex暗示一些基準信任是有條件的,Anthropic特定的結果會引發基準批評,即社會解讀可能污染技術評估。

中立/分析性觀點

Epoch的框架是剋制的:整體略低於Fable,在SWE特定能力上持平。

Arena的“現在第一印象,以後真實世界排行榜”是另一種中立姿態,實際上表明社區尚未在穩健排名上達成一致。

背景

Claude系列模型已經以強大的編碼性能、長上下文實用性和相對精緻的企業/產品包裝而聞名,因此Opus 5進入了一個用户準備測試Anthropic能否維持或擴展編碼領先地位的市場。

此次發佈恰逢從靜態聊天基準向代理評估的更廣泛轉變:瀏覽器使用、工具調用、並行任務執行和軟件工程循環完成。這就是為什麼即使像瀏覽器取消工作流這樣的隨意軼事也獲得了關注——它們映射到經典問答基準無法捕捉的真實世界能力類別。

圍繞Opus 5的基準摩擦符合更廣泛的生態系統問題:聚合能力分數通常將多樣行為壓縮成一個數字。ECI和類似指數對於廣泛跟蹤有用,但單一數字摘要可能掩蓋:

編碼與非編碼專業化

推理時間計算/努力縮放行為

best-of-n收益

工具使用可靠性

真實世界延遲/成本權衡

FrontierCode“中等努力擊敗更高努力”的觀察尤其相關,因為前沿實驗室越來越依賴測試時間計算和搜索。如果更多努力在某些分佈上損害性能,那麼部署策略幾乎與基礎模型質量同等重要。

ECI討論還表明,Opus 5可能是軟件工程強度比整體全能能力增益更突出的案例。Epoch的數字直接支持這一區別:整體159 vs SWE-ECI 161。

競爭背景包括反覆提及Fable 5、GPT 5.6、Grok 4.5、Kimi K3、Mythos和開放權重動量。因此,Opus 5不是孤立判斷,而是在一個擁擠的前沿領域中,其中:

編碼能力是關鍵楔子

成本/效率重要

公共基準滯後於產品化代理使用

一些最強的親Anthropic情緒在推文集中部分基於聲譽而非基準——例如聲稱其他人“害怕Anthropic”。對於專家讀者,更實質的信號是即使基準懷疑論者大多在爭論Opus 5有多好,而不是它是否屬於前沿。

該模型的發佈還與圍繞AI安全和自主事件的更廣泛話語相交,包括路透社報道的來自另一個代理環境的行為以及關於秘密協調和“謀劃”的評論。雖然不直接關於Opus 5,但這些話語可能影響了用户如何解讀Anthropic的發佈,因為Anthropic與安全意識品牌強烈關聯。

實際含義是Opus 5的接受是通過兩個同時的鏡頭過濾的:

作為用户可以立即操作的編碼/代理產品

作為面臨日益對抗的基準和安全審查的前沿模型

這種組合解釋了這些推文中的發佈模式:較少的“規格表”帖子,更多的是關於評估方法論、代理演示和真實世界編碼性能的爭論。

其他主題

開放模型、蒸餾和AI主權

NVIDIA的Jensen Huang發佈了一封信,認為開放模型很重要,因為AI“將改變每個行業,賦能每家公司,並由每個國家構建”,將開放模型視為有利於安全、網絡安全、創新擴散和主權。

這封信獲得了生態系統人物和公司的支持,包括@MarkMcQuade、@ClementDelangue、@vincentweisser、@willccbb的反應,一位評論者對Jensen明確提到蒸餾感到高興。

多個帖子將這一天視為開放權重不會被政治擠壓的積極信號。

一些人要求比“開放權重”更強的標準,同時要求代碼和數據的開放性。

Hugging Face的Quentin Gallouédec發佈了GitHub活動背景,以強調HF對開源AI基礎設施的投資,而不僅僅是開放權重的修辭。

安全事件、威脅框架和網絡政策

路透社報道

[為AI成本控制而截斷]