Kimi K3 vs GPT-5.6 Sol 在 DeepSWE 上的对比:成本、编码和路由
我们在 DeepSWE 上对 Kimi K3 和 GPT-5.6 Sol 进行了 904 次测试。Sol 在 pass@1 上领先;Kimi K3 在 pass@4 上以每美元解决任务数 2.8 倍的优势胜出,两者之间的路由可达约 85.6%。
在 DeepSWE 基准测试中,我们对比了 Kimi K3 和 GPT-5.6 Sol。该测试评估模型的软件工程能力,涵盖多种任务类型和编程语言。GPT-5.6 Sol 在单次尝试中表现最佳,pass@1 达到 72.7%,创下 DeepSWE 最高记录。而开源模型 Kimi K3 则在多次尝试中展现优势:pass@2 为 82.0%(Sol 81.0%),pass@4 为 89.4%(Sol 85.8%)。
成本方面,Kimi K3 每次运行仅需 4.65 美元,Sol 需 8.37 美元。每 100 美元,Kimi K3 可完成 14.7 个任务,Sol 为 5.3 个,前者效率是后者的 2.8 倍。但 Sol 运行更快(中位数 17 分钟 vs Kimi 66 分钟),且步骤更少。
在编程语言上,两者在 Go 上持平(79% 通过率)。Sol 在 Python(74% vs 68%)、TypeScript(66% vs 60%)和 JavaScript(75% vs 65%)上领先;Kimi K3 则在 Rust(65% vs 60%)上胜出。
通过分析覆盖率(至少一次通过)和可靠性(全部四次通过),Sol 可靠性更高(84.5%),61 个任务全部通过;Kimi K3 覆盖率更广(89.4%),但可靠性较低(76.6%),45 个任务全部通过。两者在任务上的相关性仅为 0.46,表明它们成功和失败的模式不同。
利用这种差异,路由策略可显著提升性能。先运行 Kimi K3,若测试套件拒绝结果则升级到 Sol,该级联策略准确率达 85.6%,超越任一单独模型,甚至优于完美单次路由器的 83.4%。成本约为每任务 7.30 美元,低于单独使用 Sol 的 8.37 美元。若两者均失败,仍有 5 个任务无法解决,需引入第三模型。
Kimi K3 为开源模型,可通过 Together AI 等平台部署,实现低成本、高覆盖的编码方案。总之,Kimi K3 在成本和多次尝试上占优,Sol 在单次质量和可靠性上领先,结合路由可最大化收益。