AI News HubLIVE
サイト内リライト2 分で読了

Kimi K3 vs GPT-5.6 Sol on DeepSWE:コスト、コーディング、ルーティング

DeepSWEでKimi K3とGPT-5.6 Solを904回テスト。Solはpass@1でリード、Kimi K3はpass@4でドルあたり2.8倍の解決数、両者のルーティングで約85.6%に到達。

DeepSWEベンチマークでKimi K3とGPT-5.6 Solを比較しました。このベンチマークはソフトウェア工学の能力を多様なタスクタイプとプログラミング言語で評価します。GPT-5.6 Solは単一試行で優れ、pass@1は72.7%でDeepSWE最高記録を達成。一方、オープンウェイトモデルKimi K3は複数試行で強みを発揮:pass@2は82.0%(Sol 81.0%)、pass@4は89.4%(Sol 85.8%)。

コスト面では、Kimi K3は1ロールアウトあたり4.65ドル、Solは8.37ドル。100ドルあたりの解決タスク数はKimiが14.7、Solが5.3で、Kimiの効率は約2.8倍。ただし、Solの実行時間は中央値17分(Kimiは66分)と速く、ステップ数も約40%少ない。

プログラミング言語別では、Goで両者同等(79%正解率)。SolはPython(74% vs 68%)、TypeScript(66% vs 60%)、JavaScript(75% vs 65%)でリード。Kimi K3はRust(65% vs 60%)で勝る。

カバレッジ(少なくとも1回成功)と信頼性(全4回成功)を分解すると、Solは信頼性84.5%で61タスクを全達成、カバレッジは85.8%。Kimi K3はカバレッジ89.4%と広いが、信頼性76.6%、45タスク全達成。両者のタスク相関は0.46と低く、成功・失敗のパターンが異なる。

この差異を活かし、Kimi K3を先に実行し、テストスイートで不合格の場合にSolにエスカレーションするカスケード戦略で、精度は約85.6%に達し、単一モデルや完全な単発ルーター(83.4%)を上回る。コストは1タスクあたり約7.30ドルで、Sol単独の8.37ドルより安い。それでも5タスクは両者で解決できず、第3のモデルが必要。

Kimi K3はオープンウェイトのため、Together AIなどのプラットフォームで低コストにデプロイ可能。コスト重視や複数試行許容のワークロードではKimiが優れ、単発品質重視ならSol。両者のルーティングで最適な結果が得られる。