AI News HubLIVE
站內改寫2 分鐘閱讀

Claude Opus 5 釋出

Anthropic 推出 Claude Opus 5,一款在編碼和知識工作方面達到新高度的高效模型,價格僅為 Claude Fable 5 的一半。它在多個基準測試中表現優異,尤其擅長軟體工程、科學研究和視覺輸出。Opus 5 具備更強的自我驗證和迭代能力,早期使用者反饋積極。儘管在網路安全方面仍落後於 Mythos 5,但其對齊性和安全性達到了最高水平。

Anthropic 於 2026 年 7 月 24 日正式釋出 Claude Opus 5。這款新模型被描述為“深思熟慮且主動”,在智慧水平上接近旗艦模型 Claude Fable 5,但價格僅為後者的一半。Opus 5 旨在成為日常使用的預設模型,現已作為 Claude Max 的預設選項,同時也是 Claude Pro 上最強大的模型。

在效能與成本效益方面,Opus 5 相比前代 Opus 4.8 實現了顯著提升,而成本保持不變。使用者可以透過調整模型的“努力程度”設定來最佳化智慧水平或節省 token,以獲得更快的響應和更低成本。在軟體工程任務中,Opus 5 表現尤為突出:在 Frontier-Bench v0.1 上,它超越了所有其他模型,每任務成本更低,效能是 Opus 4.8 的兩倍以上;在 CursorBench 3.2 上,最大努力下其得分與 Fable 5 相差不到 0.5%,但成本僅為後者的一半。在知識工作和問題解決方面,Opus 5 同樣表現出色:在 ARC-AGI 3 測試中,其得分是次優模型的三倍;在 Zapier AutomationBench 上,其透過率約為次優模型的 1.5 倍,即使在最低努力設定下,透過的任務數也超過其他任何模型;在計算機使用基準 OSWorld 2.0 上,Opus 5 以低於 Fable 5 三分之一的成本實現了更好的結果。

在科學研究領域,Opus 5 相比 Opus 4.8 有顯著改進,尤其在生命科學評估中全面領先。例如,在從光譜資料推斷分子結構的內部基準測試中,其得分高出 10.2 個百分點;在預測蛋白質序列變異影響的任務中,得分高出 7.7 個百分點。此外,Opus 5 的視覺輸出能力也大幅提升,能夠生成空氣動力學流動視覺化、細胞互動式插圖等高質量內容。

Opus 5 的一大亮點是其強大的自我驗證和迭代能力。在 Frontier-Bench 任務中,模型被要求根據無法直接檢視的機械零件圖紙重建 3D 模型,它自行編寫計算機視覺管線從原始畫素中提取幾何資訊,併成功完成任務,而其他模型在五次嘗試後仍無法解決。在修復流行開源包管理器中的真實漏洞時,Opus 5 不僅找到了根因,還修復了社群補丁遺漏的邊界情況,而競爭模型僅修復了表面症狀。早期使用者反饋也證實了其卓越效能:一家交易公司的工程師使用 Opus 5 在一個會話中構建了新交易所的市場資料訂閱,而此前模型即使有詳細計劃也無法完成;Opus 5 甚至在沒有即時資料來源驗證的情況下,自行構建了測試工具來確保程式碼正確解析資料。

多家合作伙伴對 Opus 5 給予了高度評價。Devin 發現其在 FrontierCode 1.1 上以一半成本接近 Fable 效能;Cursor 報告其在 CursorBench 上接近 Fable 5,並展現出類似行為;Zapier 自動化基準中,Opus 5 以 100% 的透過率位居榜首,成功完成從識別風險賬戶到生成留存運營摘要的完整流程;在基因組學分析中,模型表現出科學家的謹慎態度,主動選擇正確的統計測試排除混雜因素,並透過獨立方法交叉驗證結果。Lovable 指出 Opus 5 是 Opus 系列自 4.5 以來最大的飛躍,在前端動畫、遊戲和 3D 工作方面表現最佳。

在對齊與安全方面,Claude Opus 5 在預部署測試中被評為迄今為止最對齊的模型,其道德遵循程度優於 Opus 4.8、Sonnet 5 和 Fable 5,欺騙行為率最低,且不易被誘導濫用。在安全評估中,Opus 5 未在危險的通用能力方面取得進展,在生物學研究和進攻性網路安全方面仍落後於 Mythos 5。由於 Anthropic 有意避免在網路安全任務上訓練 Opus 5,儘管模型因通用能力提升而在查詢漏洞方面接近 Mythos 5,但在利用漏洞方面仍存在顯著差距。完整的系統安全卡片提供了更多細節。