アーティフィシャル・アナリシス (Artificial Analysis) は8月6日(現地時間)、人工知能(AI)の性能評価指標「インテリジェンス・インデックス (Intelligence Index)」をバージョン4.1.1にアップデートしたと発表した。このパッチリリースでは、グレーダーモデルのアップグレードと、最新版のタウキューブド・バンキング(τ³-Banking)v1.0.1の導入が主な変更点である。既存の評価セットの信頼性維持を目的とした今回のマイナーアップデート後も、Claude Opus 5はIndex 63で首位を維持していることが確認された。
今回のアップデートでは、評価プロセスの信頼性と精度を向上させるため、複数の基盤技術が刷新された。特に重要な変更点として、グレーダーパイプラインの中核をなす評価システムに、タウキューブド・バンキング (τ³-Banking) v1.0.1が導入された点が挙げられる。この最新バージョンは、シエラ (Sierra) が提供するもので、最新のアップストリームタスクバージョンが適用されている。これにより、グレーダーパイプラインの全体的な機能が改善され、以前に報告されていたリカバリーパスにおける正確性エラーが効果的に解消されたとしている。この技術的な進化は、より堅牢で信頼性の高いAIモデル評価環境の実現に貢献する。
また、今回のv4.1.1への更新では、特定の評価項目における基盤モデルの変更も実施された。具体的には、HLE、AA-LCR、およびAA-Omniscienceといった評価タスクにおいて、以前使用されていたGPT-4o、Qwen3 235B A22B 2507、およびGemini 3 Flash Previewが、より高性能なGPT-5.6 Luna (medium)に置き換えられた。この変更は、現代のAIモデルの進化に対応し、評価基準を最新かつ高性能なモデルに統合することを目的としている。これにより、評価の感受性と識別能力が向上し、モデル間の微細な性能差をより正確に捉えることが可能となる。評価に使用されるモデルの品質は、評価結果の妥当性に直結するため、この見直しはIndex全体の信頼性向上に寄与する。
これらの広範な技術的およびモデル的変更にもかかわらず、Intelligence Indexのスコアへの影響は全体的に限定的だったとされている。多くのモデルでは、スコアの変動が1ポイント未満にとどまり、大規模な順位変動は見られなかった。しかしながら、いくつかのモデルは比較的小幅ながら明確な変化を示した。具体的には、Muse Spark 1.2 (xhigh) が最大で2.7ポイントのスコア増加を記録した。これは、新しい評価基準とグレーダーモデルの恩恵を比較的大きく受けたことを示唆している。一方で、主要なリーダーボード上位のモデル順位は概ね維持されており、特にClaude Opus 5はIndex 63というスコアで引き続きトップの座を保持している。このことは、今回のアップデートが、既存の評価セットの信頼性を維持しつつ、評価基盤の現代化と精度向上を目指したマイナーアップデートであったという開発元の意図を裏付けるものとなっている。
アーティフィシャル・アナリシスは、今回のv4.1.1へのアップデートを通じて、常に進化するAI技術環境に対応し、評価手法の一貫性と独立性を確保する姿勢を示している。現在公開されている全てのモデル結果は、この最新かつ一貫性のある独立した手法を反映している。
参考: artificialanalysis.ai (アーカイブ) — 2026年8月6日 09:00 (JST)
原文ハイライト"v4.1.1 of the Artificial Analysis Intelligence Index"