【速報】BenchLM.ai、SWE-bench Pro最新結果発表 Claude Mythos 5が80.3%で首位
BenchLM.aiは2026年8月1日(現地時間)、ソフトウェアエンジニアリングタスクの評価ベンチマーク「SWE-bench Pro」の最新結果を公開した。AnthropicのClaude Mythos 5が80.3%のスコアでリーダーボードの首位を獲得し、Claude Fable 5が80%、Claude Opus 5が79.2%で続いた。計55モデルが評価対象となった。
Tag
4 件の関連記事
BenchLM.aiは2026年8月1日(現地時間)、ソフトウェアエンジニアリングタスクの評価ベンチマーク「SWE-bench Pro」の最新結果を公開した。AnthropicのClaude Mythos 5が80.3%のスコアでリーダーボードの首位を獲得し、Claude Fable 5が80%、Claude Opus 5が79.2%で続いた。計55モデルが評価対象となった。
Anthropic は2026年8月2日(現地時間)、同社の生成AIモデル「Claude Opus 5」が、AIモデルのソフトウェアエンジニアリング能力を評価するベンチマーク「SWE-bench Verified」で96%のスコアを記録し、首位を獲得したとBenchLM.aiが報じた。これに「Claude Mythos 5」が95.5%、「Claude Fable 5」が95%で続いた。上位モデルのスコアが1ポイント以内に集中しているこの結果は、当該ベンチマークがフロンティアモデルにとって飽和状態に近づいていることを示唆する。
BenchLM.aiは2026年7月10日(現地時間)、生成AIモデルのコーディング能力を測るベンチマーク「CursorBench」の最新結果を公開した。Anthropicの「Claude Fable 5」が70.5%のスコアで首位を獲得。これにOpenAIの「GPT-5.6 Sol」が67.2%、xAIの「Grok 4.5」が66.7%で続いた。この結果は、特定のプログラミングタスクにおける各モデルの性能差を明確に示すもので、開発者やプロジェクトマネージャーにとってモデル選定の重要な指標となるだろう。
BenchLM.aiは2026年6月13日(現地時間)、中国のAIモデルランキングにおいて、AlibabaのQwen3.7 Maxがスコア91でトップを獲得したと発表した。これにAlibabaのQwen3.7 Plusがスコア88で続き、DeepSeekのDeepSeek V4 Pro (Max)がスコア86で3位に入った。オープンウェイトモデルの中ではDeepSeek V4 Pro (Max)が最高評価を得ている。