アーティフィシャル・アナリシス (Artificial Analysis) は2026年8月19日(現地時間)、AIモデルの知能、性能、価格を網羅的に比較分析した最新データを公開した。同社の評価によると、知能面ではClaude Opus 5が最も高いスコアを記録した。出力速度ではCeleris-1とMercury 2が先行し、レイテンシではGemini 2.5 Flash-LiteとCommand A+が最も低い結果を示した。
アーティフィシャル・アナリシス (Artificial Analysis) の最新データComparison of Models: Intelligence, Performance & Priceによると、AIモデルの主要な性能指標が詳細に比較された。
知能においては、Claude Opus 5 (max) およびClaude Opus 5 (xhigh) が最高評価を獲得し、これにClaude Fable 5 (with fallback) とClaude Opus 5 (high) が続いた。出力速度ではCeleris-1が1916トークン/秒、Mercury 2が1161トークン/秒で最速となり、Ling 3.0 FlashおよびGemini 3.5 Flash-Liteがそれに続いた。
レイテンシでは、Gemini 2.5 Flash-Liteが0.31秒、Command A+が0.38秒で最も低い数値を記録し、Gemini 2.5 FlashとNorth Mini Codeがそれに続いている。価格面では、Devstral 2とNorth Mini Codeが0.00ドル/100万トークンで最も安価なモデルとされ、Gemma 3 4BとGemma 3 27Bが続いた。コンテキストウィンドウの大きさでは、Llama 4 Scoutが10M、Grok 4.20 0309が2Mで最大とされ、Gemini 1.5 Pro (May)とGrok 4.1 Fastがこれに続く結果となった。
同社の知能評価指標Artificial Analysis Intelligence Index v4.1.1は、GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCRの9つの評価を統合している。また、エージェントの知識作業ベンチマークとしてAA-Briefcase Eloが、知識の信頼性と幻覚の測定にはAA-Omniscience Indexが用いられている。
参考: artificialanalysis.ai (アーカイブ) — 2026年8月19日 23:47 (JST)
原文ハイライト"Celeris-1 (1916 t/s) and Mercury 2 (1161 t/s) are the fastest models"