【速報】BenchLM.ai、SWE-bench Pro最新結果発表 Claude Mythos 5が80.3%で首位
BenchLM.aiは2026年8月1日(現地時間)、ソフトウェアエンジニアリングタスクの評価ベンチマーク「SWE-bench Pro」の最新結果を公開した。AnthropicのClaude Mythos 5が80.3%のスコアでリーダーボードの首位を獲得し、Claude Fable 5が80%、Claude Opus 5が79.2%で続いた。計55モデルが評価対象となった。
Tag
3 件の関連記事
BenchLM.aiは2026年8月1日(現地時間)、ソフトウェアエンジニアリングタスクの評価ベンチマーク「SWE-bench Pro」の最新結果を公開した。AnthropicのClaude Mythos 5が80.3%のスコアでリーダーボードの首位を獲得し、Claude Fable 5が80%、Claude Opus 5が79.2%で続いた。計55モデルが評価対象となった。
tech-insider.orgは7月5日(現地時間)、Z.ai(ジー・エーアイ)が開発した大規模言語モデル「GLM-5.2」が、最新ベンチマーク結果でSWE-bench Proのオープンウェイト部門において62.1%のスコアを記録し、首位に立ったと報じた。GLM-5.2はArtificial Analysis Intelligence Indexでもオープンモデルで1位、総合で4位に位置している。一方、DeepSeek V4-ProはSWE-bench Verifiedで80.6%を達成し、Gemini 3.1 Proと同率首位となった。
ムーンショットAI(Moonshot AI)は2026年4月20日(現地時間)、大規模言語モデル「Kimi K2.6」を公開した。この発表は、高性能なモデル開発競争が新たな段階に入ったことを示唆している。フロンティアモデル市場では、オープンウェイトモデルの台頭により、プロプライエタリモデルとの性能差が縮小する傾向が見られる。Kimi K2.6の登場は、コスト効率と市場アクセスの改善をさらに加速させ、多様な産業での高性能モデルの導入を促進するとみられている。