Artificial Analysisは2026年10月4日(現地時間)、AIモデルの能力を多角的に測定するための複数の評価方法論と構成を公開した。これには、数学、科学、コーディング、推論能力を総合的に評価する複合ベンチマーク「Artificial Analysis Intelligence Index v4.3.2」や、エージェント型AIの知識労働能力を測る「AA-Briefcase v1.1」などが含まれる。

公開された評価方法論には、モデルのオープンネスを業界標準として伝えるArtificial Analysis Openness Indexがある。また、同社がフロンティアエージェントの長期的知識労働能力を評価するために開発したプライベート評価AA-Briefcase v1.1は、スプレッドシート、プレゼンテーション、メモといった成果物を必要とする現実的なビジネスワークフローでエージェントをテストする。

OpenAIのGDPvalデータセットに基づき、44の職業と9つの主要産業にわたる実世界タスクでAIモデルをテストする評価フレームワーク「GDPval-AA v2.1」も更新された。このフレームワークでは、モデルにシェルアクセスとウェブブラウジング機能が与えられ、Stirrupを介したエージェントループでタスクを解決し、ブラインドペアワイズ比較からEloレーティングが導出される。

APEX-Agents-AA Benchmark Leaderboardは、プロフェッショナルサービス環境における長期的・クロスアプリケーションタスクでAIエージェントをテストする「APEX-Agents」ベンチマークの実装である。AA-AnalystAgent Benchmark Leaderboardは、ビジネスアナリストやデータアナリストが日常的に直面する定量的質問に、スプレッドシートやドキュメントを扱って回答するAIエージェントの能力を評価する。

SaaSアプリケーション環境をシミュレートし、エージェント型タスク完了度を測定するAutomationBench-AAや、HarveyのLegal Agent Benchmark(LAB)を実装し、120のプライベートタスクにわたる法律業務でAIエージェントをテストする「Harvey LAB-AA」も含まれる。また、Surge AIのGDP.pdfベンチマークの実装であるGDP.pdf Benchmark Leaderboardでは、長文のプロフェッショナル文書に対する言語モデルの推論能力が評価される。

さらに、ServiceNowのEnterpriseOps-Gymを独自に実装したEnterpriseOps-Gym-AA Benchmark Leaderboardは、LLMエージェントがライブツール使用を介して、8つのビジネスドメインにわたるステートフルな多段階エンタープライズワークフローを完了できるかをテストする。複雑なターミナル作業を評価するTerminal-Bench 4.0や、生命科学、物理科学、地球科学、数学、工学科学といった分野の研究ワークフローを評価するTerminal-Bench-Science 0.1も追加された。

言語モデルが1万から10万トークンの長文ドキュメントから情報を抽出し、推論し、統合する能力を測定するArtificial Analysis Long Context Reasoning Benchmark、事実想起とハルシネーションを測定するAA-Omniscience: Knowledge and Hallucination Benchmarkなど、多岐にわたるベンチマークが提供されている。IBMのITBenchベンチマークを実装したITBench-AA Benchmark Leaderboardは、Kubernetesインシデントの根本原因分析でAIエージェントをテストする。


参考: artificialanalysis.ai — 2026年10月5日 00:05 (JST)

この記事をシェア
X はてブ LinkedIn