Artificial Analysisは2026年7月24日(現地時間)、Anthropicの「Claude Opus 5」が同社Intelligence Indexにおいて最高スコア61点を記録したことを発表した。この新モデルは、「Claude Fable 5 (with fallback)」に匹敵するインテリジェンスを提供しつつ、タスクあたりのコストを26%削減していると評価された。これにより、同モデルは「Claude Fable 5 (with fallback)」および「GPT-5.6 Sol」を上回る成果を示している。

Artificial Analysisが公開した評価によると、Claude Opus 5 (max)は同社Intelligence Indexで61点を獲得し、これまでの最高値を更新しました。Claude Fable 5 (with fallback)の60点、GPT-5.6 Sol (max)の59点、そして「Kimi K3」の57点を凌駕する結果です。

エージェンティック知識作業のベンチマークであるGDPval-AA v2では、Claude Opus 5 (max)が1861 Eloを獲得し、Claude Fable 5 (with fallback)およびGPT-5.6 Sol (max)を100ポイント以上リードしました。また、AA-Briefcaseでも1720 Eloを記録し、Claude Fable 5 (with fallback)を146ポイント上回っています。これらのベンチマークは、オープンソースのエージェントハーネスStirrupを用いて、モデルが正確で適切に提示されたプロフェッショナルな成果物を生成する能力をテストするものです。

コスト面では、Claude Opus 5 (max)のIntelligence Indexタスクあたりの平均コストは2.03ドルで、Claude Fable 5 (with fallback)の2.75ドルを下回ります。しかし、「Opus 4.8 (max)」の1.80ドルやClaude Sonnet 5 (max)の1.53ドルよりは高いとされています。ただし、高レベルおよびxhighレベルの推論では、「Claude Opus 5」はタスクあたりのコストを抑えつつ、「Opus 4.8」と「Claude Sonnet 5」の両方を上回る性能を発揮する可能性があると評価されています。

その他の評価では、Claude Opus 5 (xhigh)は「Claude Code」と共にArtificial Analysis Coding Indexで共同首位を獲得し、SWE-Atlas-QnAで最高スコアを記録しました。Terminal-Bench v2.1 (max effort) では89%を達成し、リーダーのGPT-5.6 Sol (xhigh)とほぼ同等と評価されています。科学的推論ではHumanity’s Last Examで53%を記録し、Claude Fable 5 (with fallback)と同水準でした。「CritPt」という物理評価ではClaude Fable 5 (with fallback)に並びましたが、「GPT-5.6 Sol」、「GPT-5.5 Pro」、「GPT-5.6 Terra」には及ばなかったとされています。

一方で、AA-Omniscienceにおける事実的知識はClaude Fable 5 (with fallback)よりも低いままであるとされています。「Opus 4.8」と比較してAA-Omniscience Accuracyは7ポイント向上しましたが、不確実な状況でより頻繁に回答したため、その幻覚率は14ポイント上昇し50%となりました。コンテキストウィンドウは「Opus 4.8」と同等の100万トークンを提供します。


参考: artificialanalysis.ai (アーカイブ) — 2026年7月24日 09:00 (JST)

この記事をシェア
X はてブ LinkedIn