Kimi K3 vs Claude Fable 5:DeepSWEにおけるコストとコーディング性能の比較
DeepSWEベンチマークでKimi K3とClaude Fable 5の452回のロールアウトを実行しました。Fableはpass@1で1.4ポイントリードするものの、Kimi K3はpass@4で勝利し、1ドルあたりの解決タスク数で2.8倍の効率を達成。Kimi K3はオープンモデルとして、Fableの3分の1のコストで高い性能を提供します。
最近のDeepSWEベンチマーク比較では、Kimi K3とClaude Fable 5がソフトウェアエンジニアリング能力において非常に接近しており、コスト面では大きな差があることが明らかになりました。オープンウェイトモデルであるKimi K3は、Claude Fable 5の3分の1未満のコストで、フラッグシップに近い性能を実現し、コストパフォーマンスに優れたデフォルトの選択肢となっています。
DeepSWEスコア:pass@1とpass@k
DeepSWEの公式スコアリングでは、Claude Fable 5(xhigh設定)のpass@1は69.9%で、Kimi K3(最大努力設定)の68.5%を1.4ポイント上回っています。これはオープンウェイトモデルとAnthropicのフラッグシップモデルの間で最も小さい差の1つであり、Kimi K3は前世代から38ポイントのジャンプを達成し、このデータセット全体で最大のバージョン間改善となっています。
複数回の試行を考慮すると(pass@k)、順位は逆転します。Kimi K3はpass@2で82.0%対80.2%でリードし、pass@4では89.4%対88.5%でFableを上回ります。44構成の全エクスポートデータにおいて、この水準に達したのは2つの低コストGPT構成(Luna maxとGPT-5.5 high、いずれも90.3%)のみです。
カバレッジと信頼性:Kimi K3とFable 5の違い
pass@1をカバレッジ(少なくとも1回成功したタスク)と信頼性(それらのタスクでの成功率)に分解すると、両モデルは異なる特性を示します。Kimi K3はベンチマークの89.4%をカバーし(どのピークよりも高い)、失敗したタスクはわずか12個(Fableは13個)です。しかし、4/4全成功の信頼性は76.6%で、45タスクのみが4回すべて成功したのに対し、Fableは79.0%で58タスクでした。Fableはより安定しており決定論的で、Kimiはより広いネットを張っており、これがpass@2と@4での優位性を説明しています。
コスト比較:Kimi K3 vs Claude Fable 5の価格
Kimi K3の1ロールアウトあたりのコストは4.65ドル、Fable xhighは13.41ドルです。452回のロールアウト全体では、Kimi K3が2,103ドル、Fableが6,010ドルとなります。
解決タスクあたりでは、Kimi K3は100ドルあたり14.7タスクを解決するのに対し、Fableは5.3タスクであり、1ドルあたりの作業量は2.8倍です。Kimi K3は実行時間が長くなりますが、モデルがオープンソース化され推論が最適化されれば改善されるでしょう。
Kimi K3とClaude Fable 5の類似性
タスクごとの相関分析では、Kimi K3とFableの相関係数は0.72であり、ベンチマーク全体でベンダー間の類似性としては最高です。実際、エクスポートデータにおける上位4つのベンダー間類似性はすべてKimi K3とAnthropicモデルのペアです。一方が4回全勝し、他方が4回全敗するタスクは1つもなく、これは分析したすべてのペアで初めてのことです。両モデルとも96タスクを解決し、Kimiのみが5タスク、Fableのみが4タスクを追加し、8タスクは両者とも解決できませんでした。
失敗パターンもよく一致しており、両者とも失敗の65%は「惜しい」失敗であり、既存のテストスイートを保護する能力も類似しています(ベースライン回帰率はそれぞれ11%と10%)。
実際には、Kimi K3とClaude Fable 5はほぼ同じタスクで成功・失敗するため、これらをペアにしても多様性はほとんど得られません。両者の和集合は113タスク中105タスクをカバーし、Kimi単独の101タスクをわずかに上回るのみです。
プログラミング言語別の比較:Kimi K3 vs Fable 5
Kimi K3はGo言語で79%対71%と明確に勝っています。Fableは他の4言語でリードしています:Python 74%対68%、JavaScript 70%対65%、TypeScript 64%対60%、Rust 75%対65%。注目すべきは、Kimi K3がRustタスクでFableに迫っている点です。これは他のモデル(GPT 5.6 Solを含む)では見られない特性です。
意味するところ
Kimi K3は今や合理的なデフォルト選択です:フラッグシップに近いリーチ、最高のpass@4性能を、Fableの35%のコストで実現します。オープンウェイトモデルとして、ウェイトが公開されれば、Together AIなどの推論プロバイダーを通じて、フロンティアモデルのトークン価格を気にせず、自社の条件で広範なpass@kネットを活用できます。
Kimi K3とClaude Fable 5の比較は、オープンモデルがクローズドモデルとの差を急速に縮めており、特にコストと複数試行のカバレッジにおいて明確な優位性を示していることを浮き彫りにしています。