Kimi K3 vs Claude Fable 5:DeepSWE上的成本与编码能力对比
我们在DeepSWE基准上对Kimi K3和Claude Fable 5进行了452次实验。Fable在pass@1上领先1.4个百分点,但Kimi K3在pass@4上胜出,且每美元解决问题的数量是Fable的2.8倍。Kimi K3作为开源模型,成本仅为Fable的三分之一,是追求性价比的理性选择。
最新发布的DeepSWE基准测试对比显示,Kimi K3和Claude Fable 5在软件工程能力上旗鼓相当,但成本差异巨大。Kimi K3作为开源模型,以不到Claude Fable 5三分之一的成本,提供了接近旗舰级别的性能,成为高性价比的默认选择。
DeepSWE评分:pass@1与pass@k
在DeepSWE官方评分中,Claude Fable 5(xhigh配置)的pass@1为69.9%,而Kimi K3(最大努力配置)为68.5%,仅落后1.4个百分点。这是开源模型与Anthropic旗舰模型之间最小的差距之一,且Kimi K3相比前代模型提升了38个百分点,是该数据集上最大的跨版本提升。
当考虑多次尝试时(pass@k),排名发生逆转。Kimi K3在pass@2上以82.0%对80.2%领先,pass@4上以89.4%对88.5%超越Fable。在整个44个配置的导出数据中,只有两个低成本的GPT配置(Luna max和GPT-5.5 high,均为90.3%)曾达到更高水平。
覆盖度与可靠性:Kimi K3与Fable 5的差异
将pass@1分解为覆盖度(至少成功一次的任务)和可靠性(这些任务上的成功率),两个模型展现出不同特点。Kimi K3覆盖了89.4%的基准任务——高于任何峰值,仅有12个任务从未成功(Fable为13个)。但在4/4全部成功的可靠性上,Kimi K3为76.6%,仅45个任务四次全部成功,而Fable为79.0%和58个任务。Fable更稳定、更确定,而Kimi是更宽的网,这解释了它在pass@2和pass@4上的优势。
成本对比:Kimi K3 vs Claude Fable 5定价
Kimi K3每次部署成本为4.65美元,Fable xhigh为13.41美元。完整的452次部署成本:Kimi K3为2,103美元,Fable为6,010美元。
每解决一个任务,Kimi K3每100美元可完成14.7个任务,而Fable为5.3个——每美元工作量是Fable的2.8倍。Kimi K3运行时间更长,但随着模型开源和推理优化,这一情况有望改善。
Kimi K3与Claude Fable 5的相似性
每个任务的相关性分析显示,Kimi K3与Fable之间的相关系数为0.72——这是整个基准中跨供应商的最高相似度。事实上,导出数据中前四的跨供应商相似度都是Kimi K3与Anthropic模型对。没有出现一个模型四次全胜而另一个四次全败的任务,这是所有已分析配对中的首次。两者都解决了96个任务,Kimi独有5个,Fable独有4个,另有8个任务两者都无法解决。
它们的失败模式也高度一致:65%的失败是“接近成功”,两者保护现有测试套件的能力也相近(基线回归率分别为11%和10%)。
实际上,Kimi K3和Claude Fable 5在几乎相同的任务上成功或失败,因此将它们配对几乎无法带来多样性:它们的并集覆盖了113个任务中的105个,仅略高于Kimi单独的101个。
按编程语言对比Kimi K3与Fable 5
Kimi K3在Go语言上以79%对71%胜出。Fable在其他四种语言上领先:Python 74%对68%、JavaScript 70%对65%、TypeScript 64%对60%、Rust 75%对65%。值得注意的是,Kimi K3在Rust任务上追平Fable的程度远超其他模型——甚至GPT 5.6 Sol也不如它在Rust上表现好。
意义
Kimi K3现在成为理性默认选择:接近旗舰的覆盖范围,最佳旗舰级配置的pass@4,成本仅为Fable的35%。作为开源模型,一旦权重发布,团队可以完全控制部署,通过Together AI等推理提供商以生产规模运行,无需支付前沿模型的令牌价格。
Kimi K3和Claude Fable 5的对比表明,开源模型正在迅速缩小与闭源模型的差距,尤其在成本和多次尝试的覆盖面上展现出明显优势。