Anthropic (アンソロピック) の言語モデル「Claude Opus 5.5」は2026年10月9日(現地時間)、ソフトウェアエンジニアリングタスクの評価ベンチマーク「SWE-bench Pro」の最新リーダーボードで首位に立った。同モデルは89.9%のスコアを記録し、Claude Sonnet 5.5(81.3%)とClaude Fable 5.1(81.2%)が続いた。リーダーボードには78のモデルが掲載されている。
Anthropicの「Claude Opus 5.5」は2026年10月9日(現地時間)に更新されたSWE-bench Proリーダーボードにおいて、89.9%のスコアでトップに立った。2位は同じくAnthropicのClaude Sonnet 5.5で81.3%、3位はClaude Fable 5.1で81.2%だった。これら上位3モデルはいずれもAnthropicが開発したものだ。
SWE-bench Proは、ソフトウェアエンジニアリングタスクにおけるエージェントの能力を評価するベンチマークである。エージェントにはリポジトリとその中に存在する課題の説明が与えられ、既存の動作を壊さずに新しいテストに合格するパッチを生成できるかが評価される。このベンチマークは、公共、非公開、商業の3つのカテゴリにまたがる41のリポジトリから集められた1,865の課題で構成されており、複数のファイルにわたる長期的な作業を扱うことが特徴だ。評価機関benchlm.aiによると、SWE-bench Proは同機関が定める「Coding」カテゴリに分類され、このカテゴリの参照ウェイトの26%を占めている。
最新のリーダーボードには合計78のモデルが掲載されている。Anthropicの各モデルのほか、Sakana AI (サカナAI) のSakana Fugu-Ultraが7位(73.7%)、Alibaba (アリババ) の「Qwen3.8 Max」が9位(67.7%)、Tencent (テンセント) の「Hy4 preview」が10位(65.7%)にランクインした。また、xAI (エックスAI) の「Grok 4.5」が13位(64.7%)、OpenAIの「GPT-5.6 Sol」が14位(64.6%)だった。これらのモデルは多様な組織から提供されており、多くがパラメータサイズを「Not reported」としている。ベンチマークのページでは、SWE-bench Proのスコアはモデルのソフトウェアエンジニアリング能力を特定する上で有効であるとされている。このベンチマークは、AIエージェントがソフトウェア開発の複雑な問題をどれだけ効果的に解決できるかを示す重要な指標となっている。
参考: benchlm.ai — 2026年10月10日 09:00 (JST)