Together AIは2026年7月23日(現地時間)、同社のブログでKimi K3とClaude Fable 5のDeepSWEベンチマーク比較結果を公開した。この比較では、Kimi K3が品質面でClaude Fable 5に匹敵し、タスク解決あたりのコストで約3分の1という結果を示した。Kimi K3はオープンウェイトモデルであり、DeepSWEにおけるpass@4ではClaude Fable 5を上回る性能を発揮している。
Together AIのブログ記事は、Kimi K3とAnthropicのClaude Fable 5のDeepSWEベンチマークにおけるソフトウェアエンジニアリング能力を評価した。DeepSWEは、多様なタスクタイプとプログラミング言語でモデルのソフトウェアエンジニアリング能力をテストするベンチマークである。
DeepSWE pass@1のスコアでは、Claude Fable 5が69.9%に対しKimi K3は68.5%で、Claude Fable 5が1.4ポイントの差でリードした。しかし、試行回数を増やすとKimi K3が優位となり、pass@2ではKimi K3が82.0%でClaude Fable 5の80.2%を、pass@4ではKimi K3が89.4%でClaude Fable 5の88.5%をそれぞれ上回った。
コスト面では、Kimi K3は1ロールアウトあたり4.65ドル、Claude Fable 5は13.41ドルであり、Kimi K3が大幅に安価である。1ドルあたりのタスク解決数では、Kimi K3がClaude Fable 5の2.8倍に達する。
信頼性においては、Claude Fable 5がより安定しており、4回試行全てで解決したタスク数が58であるのに対し、Kimi K3は45であった。しかし、Kimi K3はより広範なタスクをカバーしており、pass@2およびpass@4での向上に貢献している。
プログラミング言語別では、Kimi K3がGoでClaude Fable 5を上回った。一方、Claude Fable 5はPython, JavaScript, TypeScript, Rustでリードした。両モデルのタスクごとの相関性は0.72と高く、異なるベンダー間では最も高い類似性を示している。Kimi K3はMoonshot AIが開発したオープンウェイトモデルであり、Claude Fable 5はAnthropicのクローズドモデルである。
参考: Together AI Blog (アーカイブ) — 2026年7月24日 09:00 (JST)