跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

Kimi K3 vs GPT-5.6 Sol 在 DeepSWE 上的對比:成本、編碼和路由

文章摘要

我們在 DeepSWE 上對 Kimi K3 和 GPT-5.6 Sol 進行了 904 次測試。Sol 在 pass@1 上領先;Kimi K3 在 pass@4 上以每美元解決任務數 2.8 倍的優勢勝出,兩者之間的路由可達約 85.6%。

Kimi K3 vs GPT-5.6 Sol 在 DeepSWE 上的對比:成本、編碼和路由
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在 DeepSWE 基準測試中,我們對比了 Kimi K3 和 GPT-5.6 Sol。該測試評估模型的軟件工程能力,涵蓋多種任務類型和編程語言。GPT-5.6 Sol 在單次嘗試中表現最佳,pass@1 達到 72.7%,創下 DeepSWE 最高記錄。而開源模型 Kimi K3 則在多次嘗試中展現優勢:pass@2 為 82.0%(Sol 81.0%),pass@4 為 89.4%(Sol 85.8%)。

成本方面,Kimi K3 每次運行僅需 4.65 美元,Sol 需 8.37 美元。每 100 美元,Kimi K3 可完成 14.7 個任務,Sol 為 5.3 個,前者效率是後者的 2.8 倍。但 Sol 運行更快(中位數 17 分鐘 vs Kimi 66 分鐘),且步驟更少。

在編程語言上,兩者在 Go 上持平(79% 通過率)。Sol 在 Python(74% vs 68%)、TypeScript(66% vs 60%)和 JavaScript(75% vs 65%)上領先;Kimi K3 則在 Rust(65% vs 60%)上勝出。

通過分析覆蓋率(至少一次通過)和可靠性(全部四次通過),Sol 可靠性更高(84.5%),61 個任務全部通過;Kimi K3 覆蓋率更廣(89.4%),但可靠性較低(76.6%),45 個任務全部通過。兩者在任務上的相關性僅為 0.46,表明它們成功和失敗的模式不同。

利用這種差異,路由策略可顯著提升性能。先運行 Kimi K3,若測試套件拒絕結果則升級到 Sol,該級聯策略準確率達 85.6%,超越任一單獨模型,甚至優於完美單次路由器的 83.4%。成本約為每任務 7.30 美元,低於單獨使用 Sol 的 8.37 美元。若兩者均失敗,仍有 5 個任務無法解決,需引入第三模型。

Kimi K3 為開源模型,可通過 Together AI 等平台部署,實現低成本、高覆蓋的編碼方案。總之,Kimi K3 在成本和多次嘗試上佔優,Sol 在單次質量和可靠性上領先,結合路由可最大化收益。

展開要點與分析

文章情報

工程師進階

要點

  • Sol 的單次通過率(pass@1)為 72.7%,Kimi K3 為 68.5%。
  • Kimi K3 在 pass@4 上達到 89.4%,高於 Sol 的 85.8%。
  • Kimi K3 每次運行成本為 4.65 美元,遠低於 Sol 的 8.37 美元。
  • 路由策略(先 Kimi 後 Sol)可覆蓋 108/113 個任務,準確率約 85.6%。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。