AI News HubLIVE
站內改寫2 分鐘閱讀

Kimi K3 vs Claude Fable 5:DeepSWE上的成本與編碼能力對比

我們在DeepSWE基準上對Kimi K3和Claude Fable 5進行了452次實驗。Fable在pass@1上領先1.4個百分點,但Kimi K3在pass@4上勝出,且每美元解決問題的數量是Fable的2.8倍。Kimi K3作為開源模型,成本僅為Fable的三分之一,是追求價效比的理性選擇。

最新發布的DeepSWE基準測試對比顯示,Kimi K3和Claude Fable 5在軟體工程能力上旗鼓相當,但成本差異巨大。Kimi K3作為開源模型,以不到Claude Fable 5三分之一的成本,提供了接近旗艦級別的效能,成為高價效比的預設選擇。

DeepSWE評分:pass@1與pass@k

在DeepSWE官方評分中,Claude Fable 5(xhigh配置)的pass@1為69.9%,而Kimi K3(最大努力配置)為68.5%,僅落後1.4個百分點。這是開源模型與Anthropic旗艦模型之間最小的差距之一,且Kimi K3相比前代模型提升了38個百分點,是該資料集上最大的跨版本提升。

當考慮多次嘗試時(pass@k),排名發生逆轉。Kimi K3在pass@2上以82.0%對80.2%領先,pass@4上以89.4%對88.5%超越Fable。在整個44個配置的匯出資料中,只有兩個低成本的GPT配置(Luna max和GPT-5.5 high,均為90.3%)曾達到更高水平。

覆蓋度與可靠性:Kimi K3與Fable 5的差異

將pass@1分解為覆蓋度(至少成功一次的任務)和可靠性(這些任務上的成功率),兩個模型展現出不同特點。Kimi K3覆蓋了89.4%的基準任務——高於任何峰值,僅有12個任務從未成功(Fable為13個)。但在4/4全部成功的可靠性上,Kimi K3為76.6%,僅45個任務四次全部成功,而Fable為79.0%和58個任務。Fable更穩定、更確定,而Kimi是更寬的網,這解釋了它在pass@2和pass@4上的優勢。

成本對比:Kimi K3 vs Claude Fable 5定價

Kimi K3每次部署成本為4.65美元,Fable xhigh為13.41美元。完整的452次部署成本:Kimi K3為2,103美元,Fable為6,010美元。

每解決一個任務,Kimi K3每100美元可完成14.7個任務,而Fable為5.3個——每美元工作量是Fable的2.8倍。Kimi K3執行時間更長,但隨著模型開源和推理最佳化,這一情況有望改善。

Kimi K3與Claude Fable 5的相似性

每個任務的相關性分析顯示,Kimi K3與Fable之間的相關係數為0.72——這是整個基準中跨供應商的最高相似度。事實上,匯出資料中前四的跨供應商相似度都是Kimi K3與Anthropic模型對。沒有出現一個模型四次全勝而另一個四次全敗的任務,這是所有已分析配對中的首次。兩者都解決了96個任務,Kimi獨有5個,Fable獨有4個,另有8個任務兩者都無法解決。

它們的失敗模式也高度一致:65%的失敗是“接近成功”,兩者保護現有測試套件的能力也相近(基線迴歸率分別為11%和10%)。

實際上,Kimi K3和Claude Fable 5在幾乎相同的任務上成功或失敗,因此將它們配對幾乎無法帶來多樣性:它們的並集覆蓋了113個任務中的105個,僅略高於Kimi單獨的101個。

按程式語言對比Kimi K3與Fable 5

Kimi K3在Go語言上以79%對71%勝出。Fable在其他四種語言上領先:Python 74%對68%、JavaScript 70%對65%、TypeScript 64%對60%、Rust 75%對65%。值得注意的是,Kimi K3在Rust任務上追平Fable的程度遠超其他模型——甚至GPT 5.6 Sol也不如它在Rust上表現好。

意義

Kimi K3現在成為理性預設選擇:接近旗艦的覆蓋範圍,最佳旗艦級配置的pass@4,成本僅為Fable的35%。作為開源模型,一旦權重發布,團隊可以完全控制部署,透過Together AI等推理提供商以生產規模執行,無需支付前沿模型的令牌價格。

Kimi K3和Claude Fable 5的對比表明,開源模型正在迅速縮小與閉源模型的差距,尤其在成本和多次嘗試的覆蓋面上展現出明顯優勢。