Opus 5價格僅為三分之一——而這恰恰是問題所在
Anthropic的Opus 5比Fable 5更便宜、限制更少,在代理程式設計任務中以較低成本表現出色。然而,其自主性給團隊帶來了安全性和成本管理挑戰。
上週五,Anthropic釋出了其重量級模型的最新迭代版本Opus 5。距離Opus 4.8僅兩個月,繼6月釋出的Mythos 5、Fable 5和Sonnet 5之後,Opus 5補全了新一代模型陣容——僅剩輕量級Haiku等待升級。
雖然比旗艦模型Fable 5更小,但Opus 5的價格顯著更低,限制也明顯更少。Opus 5旨在無需頻繁人工干預的情況下,長時間處理程式設計任務。
定價為每百萬輸入代幣5美元、每百萬輸出代幣25美元,Opus 5顛覆了代理型任務的價效比。在Frontier-Bench和GDPval-AA等程式設計和知識工作評估中,Opus 5達到了新的最先進水平。在OSWorld 2.0計算機使用基準測試中,它以不到Fable 5最佳結果三分之一的成本超越了所有其他模型。在ARC-AGI 3(一種需解決新問題的評估)中,其得分是次優模型的三倍。
由於執行成本更低,團隊可以負擔讓Opus 5處理更大規模的程式設計任務。這也意味著需要重新考慮安全性。Anthropic在公告中寫道,Opus 5“在驗證其工作並仔細迭代直至成功方面強得多”。在基準測試中,模型被給予不完整的提示,並被故意阻止檢視機器零件的圖紙。模型並未放棄,而是編寫了自己的計算機視覺管線,從影像資料中重建了零件。
當模型在多個系統中無需持續人工監督而工作時,訪問許可權必須是臨時的且易於撤銷。這就是為什麼短期即時憑據正受到更多關注,類似於1Password正在為Claude開發的委託認證模型。給AI賦予不懈的永續性有一個問題:它不知道何時停止。標準的API日誌無法及時標記這種行為。團隊需要構建更智慧的遙測系統,真正理解工作流程的上下文。你需要一個語義斷路器,在模型燒完你的計算預算之前拔掉插頭。
Opus 5降低了每個代幣的價格標籤,但自主編碼仍可能迅速變得昂貴。一個代理在後臺迴圈工作數小時,在移交PR之前會消耗數百萬代幣。對於平臺團隊而言,按會話管理支出成為新的運營要求。為了保持這些後臺作業不會因邊緣情況而崩潰,Anthropic正在推出自動回退功能測試版。如果提示觸發了Opus 5的安全分類器,API會靜默地將任務路由到Opus 4.8,而不是丟擲硬錯誤並終止整個管線。
Opus 5還繼承了其前身的零保留策略,繞過了Fable和Mythos所需的30天資料記錄。為了理解Anthropic期望這些環境工具在何處執行,有必要看看他們如何人為地限制模型。該公司正在短期能力與長期安全之間謹慎權衡。
Anthropic發言人告訴The New Stack,與Opus 4.8相比,Opus 5在生物學任務上有“有意義的改進”,使其成為“科學研究中我們最強大的通用可用模型”。在內部有機化學基準測試(如從光譜資料推斷分子結構)中,得分高出10.2個百分點;在預測蛋白質序列變異如何決定功能方面,得分高出7.7個百分點。然而,Anthropic的測試揭示了“長期自主研究任務的顯著侷限性”,他們認為這帶來了最高的潛在風險。因此,Opus 5保留了與Opus 4.8類似的生物安全措施組合。雖然Fable 5上被阻止的生物學相關請求現在將路由到Opus 5而非4.8,但不受限制的Mythos 5對於長期、開放式工作(如自主藥物設計活動)仍是更強的模型。
Opus 5可以審查原始碼進行防禦性安全工作。Anthropic表示,這些安全措施的啟用頻率應遠低於Fable 5——根據公司說法,降低約85%。顯然,模型正在快速改進,但現在更大的挑戰是確保它們執行所在的平臺能夠跟上步伐。