Anthropic Opus 5:性能接近Fable 5,價格減半
Anthropic發佈Opus 5,性能接近旗艦模型Fable 5,但價格僅為後者一半。新模型在多項基準測試中表現優異,尤其在知識工作和編碼方面。Anthropic強調其安全性和對齊性,並推出快速模式等新功能。
Anthropic於週五發佈了Opus 5,這是其前旗艦模型系列的最新版本。儘管Fable 5作為公司的頂級模型推出,但Opus 5在多個領域的表現已接近Fable 5,而價格僅為後者的一半——每百萬輸入/輸出代幣費用保持$5/$25不變,與Opus 4.8相同。與Fable 5不同,用户無需選擇加入30天的數據保留政策即可使用Opus 5。目前,Opus 5已成為Claude Max用户的默認模型,也是Claude Pro訂閲用户能訪問的最佳模型。
Opus 5是Anthropic迄今為止最強大的Opus模型,能夠更長時間地自主工作,自我檢查並從錯誤中恢復。然而,Anthropic表示,對於“最雄心勃勃的工作”和需要數天自主性的項目,Fable 5仍是首選。Opus 4則被描述為“設計用於日常使用”。值得注意的是,在Anthropic分享的幾乎所有基準測試中,Opus 5實際上都超越了Fable 5,而Fable 5的優勢主要在於長時間處理複雜項目的能力。
在基準測試方面,Opus 5在知識工作基準GDPval-AA v2上獲得1861分,領先於Fable 5(1747)、GPT-5.6 Sol(1736)和Opus 4.8(1593)。在Zapier的AutomationBench(衡量AI代理端到端業務工作流)上,Opus 5的通過率是同等成本下次優模型的兩倍,即使在最低努力設置下,其通過的任務也超過其他任何模型。在編碼方面,Anthropic表示,在CursorBench 3.2上,Opus 5在高、超高和最大設置下均實現了每成本的最佳性能;在最大努力下,其得分僅比Fable 5的峯值低0.5%,而每任務成本減半。
安全方面,Anthropic稱Opus 5是其迄今為止最對齊的模型,與Fable 5一樣不易被誘騙濫用。公司故意未在網絡安全任務上訓練該模型,但Opus 5在發現開源代碼漏洞方面仍接近Mythos 5,而在實際利用漏洞方面則遠遠落後——這正是Anthropic所期望的。Opus 5配備了一套安全分類器,用於篩選涉及漏洞生成和滲透測試等狹窄範圍的網絡任務。這些分類器的範圍比Fable 5的更窄,Anthropic預計其干預頻率將降低約85%。當分類器標記請求時,默認回退到Opus 4.8,API用户可啓用相同行為。企業和Anthropic網絡驗證計劃的研究人員可獲得限制較少的Opus 5版本。
Anthropic還推出了“快速模式”,可將輸出代幣生成速度提高2.5倍,但成本增加2倍。此外,還推出了自動回退功能,允許被安全分類器拒絕的請求自動路由到其他模型,以及上下文工具切換功能,可在不使提示緩存失效的情況下更改Claude可用的工具。Opus 5現已面向所有Anthropic付費計劃及Claude平台提供,模型名為claude-opus-5。