Kimi K3 vs GPT-5.6 Sol 在 DeepSWE 上的對比:成本、編碼和路由
我們在 DeepSWE 上對 Kimi K3 和 GPT-5.6 Sol 進行了 904 次測試。Sol 在 pass@1 上領先;Kimi K3 在 pass@4 上以每美元解決任務數 2.8 倍的優勢勝出,兩者之間的路由可達約 85.6%。
在 DeepSWE 基準測試中,我們對比了 Kimi K3 和 GPT-5.6 Sol。該測試評估模型的軟件工程能力,涵蓋多種任務類型和編程語言。GPT-5.6 Sol 在單次嘗試中表現最佳,pass@1 達到 72.7%,創下 DeepSWE 最高記錄。而開源模型 Kimi K3 則在多次嘗試中展現優勢:pass@2 為 82.0%(Sol 81.0%),pass@4 為 89.4%(Sol 85.8%)。
成本方面,Kimi K3 每次運行僅需 4.65 美元,Sol 需 8.37 美元。每 100 美元,Kimi K3 可完成 14.7 個任務,Sol 為 5.3 個,前者效率是後者的 2.8 倍。但 Sol 運行更快(中位數 17 分鐘 vs Kimi 66 分鐘),且步驟更少。
在編程語言上,兩者在 Go 上持平(79% 通過率)。Sol 在 Python(74% vs 68%)、TypeScript(66% vs 60%)和 JavaScript(75% vs 65%)上領先;Kimi K3 則在 Rust(65% vs 60%)上勝出。
通過分析覆蓋率(至少一次通過)和可靠性(全部四次通過),Sol 可靠性更高(84.5%),61 個任務全部通過;Kimi K3 覆蓋率更廣(89.4%),但可靠性較低(76.6%),45 個任務全部通過。兩者在任務上的相關性僅為 0.46,表明它們成功和失敗的模式不同。
利用這種差異,路由策略可顯著提升性能。先運行 Kimi K3,若測試套件拒絕結果則升級到 Sol,該級聯策略準確率達 85.6%,超越任一單獨模型,甚至優於完美單次路由器的 83.4%。成本約為每任務 7.30 美元,低於單獨使用 Sol 的 8.37 美元。若兩者均失敗,仍有 5 個任務無法解決,需引入第三模型。
Kimi K3 為開源模型,可通過 Together AI 等平台部署,實現低成本、高覆蓋的編碼方案。總之,Kimi K3 在成本和多次嘗試上佔優,Sol 在單次質量和可靠性上領先,結合路由可最大化收益。