artificialanalysis.aiは2026年9月14日(現地時間)、主要なAIモデルの各リリースバージョンを横断的に比較するツールを公開しました。このツールは、Anthropic のClaude Fable 5.1とOpenAIのGPT-6 Astraをはじめとする複数のモデルについて、Intelligence Index、コスト、出力速度、レイテンシなどの詳細な指標に基づき、その性能と効率を評価しています。各モデルの異なるバリアント間のトレードオフが可視化されています。

artificialanalysis.aiが公開した比較ツールは、最大5つのモデルリリースを並行して評価できる機能を備えています。評価対象は、インテリジェンス、価格設定、出力速度、レイテンシ、コンテキストウィンドウなど多岐にわたります。このツールは、AnthropicのClaude Fable 5.1およびOpenAIのGPT-6 Astraの詳細なデータを提供し、さらにMeta、Alibaba、Z AI、SpaceXAI、Kimiなどのモデルについても言及しています。

評価の主要な指標として、Artificial Analysis Intelligence Index v4.3が用いられています。このインデックスは、AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity’s Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1を含む10種類の評価項目を統合したものです。ツールでは、Intelligence Indexとタスクあたりのコスト、タスクあたりの時間、タスクあたりの出力トークン数との関係が分析されています。

コスト面では、Cost per Intelligence Index Taskとして、タスクあたりの平均コストがドル建てで算出されています。これは、入力、キャッシュヒット、キャッシュライト、推論、応答トークンの価格を基に計算され、各評価のIntelligence Indexの重みに応じて調整されます。例えば、GPT-6 Astra (low) はタスクあたりのコストが0.82ドルと最も低く、Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) は7.63ドルでした。速度に関しては、「Output Speed」が出力トークン毎秒で示されており、高いほど優れていると評価されます。

また、特定の能力や業界に特化したCapability Indicesも提供されており、Finance & Accounting Index、Strategy & Ops Index、Legal Index、Healthcare & Medical Index、Engineering Index、Economics Indexといった項目でモデルのパフォーマンスが測定されています。各モデルの技術仕様も開示されており、コンテキストウィンドウ、Knowledge Cutoff、入出力モダリティなどが一覧で確認できます。例えば、GPT-6 AstraのKnowledge Cutoffは2026年4月とされていますが、Claude Fable 5.1のKnowledge Cutoffは指定されていません。


参考: artificialanalysis.ai — 2026年9月15日 00:00 (JST)

原文ハイライト

"Release Comparison Tool Compare up to five model releases side by side"

この記事をシェア
X はてブ LinkedIn