AI News HubLIVE
站內改寫3 分鐘閱讀

認識全新的Claude Opus 5:以不變的Opus價格提供前沿級別的代理編碼和計算機使用

Anthropic釋出了Claude Opus 5,取代Opus 4.8成為Opus系列旗艦模型。定價不變(輸入每百萬token5美元,輸出25美元),效能接近Claude Fable 5的一半價格。主要變化包括思考功能預設開啟、API破壞性變更、以及刪除驗證提示。在代理編碼和計算機使用基準測試中表現卓越,尤其是在OSWorld和Zapier AutomationBench上。安全方面,僅放寬了原始碼漏洞查詢的限制,而利用路徑仍被阻止。

來源MarkTechPost作者: Asif Razzaq

Anthropic於今日正式釋出Claude Opus 5,這款新模型取代了Opus 4.8成為Opus系列的旗艦產品。定價保持原有水平,即每百萬輸入token收費5美元,每百萬輸出token收費25美元。據Anthropic團隊介紹,Opus 5在智慧程度上已接近Claude Fable 5,但價格僅為後者的一半。目前,Opus 5已成為Claude Max的預設模型,同時也是Claude Pro中最強大的選項。

在API層面,Opus 5帶來了三項重要變化。首先,思考(Thinking)功能預設開啟,而在Opus 4.8上,除非明確設定thinking: {type: "adaptive"},否則請求不會觸發思考。Opus 5則會自動進行思考,並透過effort引數控制深度。由於max_tokens上限同時包含思考過程和回覆文本,開發者需重新評估現有設定。其次,這是一個破壞性變更:將thinking設為{type: "disabled"}並配合xhigh或max的努力級別將返回400錯誤。該限制在每個請求上強制執行,開發者要麼將努力限制在high,要麼完全移除thinking欄位。最後,Anthropic建議開發者刪除驗證提示(verification prompts),例如“包含最終驗證步驟”這類指令可能導致過度驗證,因為模型本身已具備自我驗證能力。Opus 5的提示指南詳細介紹了調優模式。

模型ID為claude-opus-5,上下文視窗預設和最大值均為100萬token,無更小版本。同步Messages API的最大輸出為128k token,而Messages Batches API透過新增output-300k-2026-03-24 beta頭可實現300k token輸出。此外,最小可快取提示降至512 token,相比此前的1024 token有所減少。

在編碼和代理能力方面,Opus 5取得了顯著進步。在替代Terminal-Bench 2.1的74項任務基準FrontierBench v0.1上,Opus 5在最大努力下得分為43.3%,遠高於Opus 4.8的18.7%,同時也超過了Fable 5(33.7%)和GPT-5.6 Sol(37.5%)。在xhigh努力下,Opus 5達到了44.4%的最佳平均獎勵。值得注意的是,測試中Opus 5的安全分類器標記並拒絕了5%的API呼叫,涉及4%的試驗,而Fable 5的這一比例高達42%和26%。

在SWE-bench Verified上,Opus 5得分96.0%,在SWE-bench Pro上為79.2%,略低於Fable 5的80.0%。SWE-bench Multimodal的提升更為顯著,從38.4%躍升至59.4%。代理任務是最明顯的強項:OSWorld 2.0上Opus 5達到70.57%,而Opus 4.8為55.7%;Zapier AutomationBench上得分為26.0%,高於Opus 4.8的17.0%和Fable 5的17.4%。即使在中等努力下,它也能以每任務0.89美元的成本獲得24%的得分。

在推理方面,Anthropic讓Opus 5在沒有工具或代理框架的情況下解答了所有六道IMO 2026問題。由三個模型組成的評審小組判定所有24個生成的解答正確,人類專家對每道題預選的一個解答評分均為7/7,最終總分42/42達到了金牌水平,遠超29/42的分數線。在ARC-AGI-3上,ARC Prize基金會驗證了Opus 5在高努力下30.16%的得分,大約是此前最佳排行榜得分的四倍(GPT-5.6 Sol為7.78%,Opus 4.8為1.52%)。在“人類最後的考試”中,Opus 5無需工具得分為56.3%,使用工具後升至64.7%。

多模態任務中,工具的使用比單純的思考更有效。在Chartography上,無工具時Opus 5得分為29.6%,但配合容器和影像裁剪工具後升至83.0%。在BenchCAD Vision2Code上,體素IoU從0.366提升至0.821,超過Claude Mythos 5的0.678。

網路安全能力也隨之提升,儘管Anthropic並未專門針對網路安全任務訓練Opus 5。在ExploitBench的AutoNudge分支中,Opus 5獲得了10.14的平均能力標誌,生成了99個完整的任意程式碼執行漏洞利用,而Mythos 5為132個。在OSS-Fuzz上,Opus 5在79.4%的目標上獲得非零分數,與Mythos 5的80%接近,但Opus 5完成了4個完整利用,而Mythos 5為13個。這一差距體現了安全設計原則:Opus 5在發現漏洞方面幾乎與Mythos 5一樣強大,但在利用方面明顯落後。因此,Anthropic僅開放了原始碼漏洞查詢,二進位制掃描、滲透測試和漏洞利用生成仍被禁止。分類器的干預頻率預計比Fable 5低約85%。英國AISI的測試顯示,Opus 5在“The Last Ones”任務中10次嘗試有8次成功完成,在更難的“Doing Life”任務中達到了第22步(共23步),優於任何先前測試的模型。

在間接提示注入方面,Opus 5表現出色。在Gray Swan基準測試中,15次嘗試內的攻擊成功率從Opus 4.8的5.5%降至2.0%,而Mythos 5為2.6%,GPT-5.6 Sol高達20.0%。在Claude Cowork瀏覽器環境中,攻擊成功率從31.5%降至3.70%(無安全措施),啟用自動模式後在全部129個環境中降為0%。

總體而言,Claude Opus 5在保持定價不變的同時,在代理編碼、推理和安全方面實現了跨越式進步。社群反饋積極,儘管Anthropic也坦承模型在事實性幻覺方面略高於Opus 4.8。這款模型現已透過Claude API和各個平臺提供。