Artificial Analysisは9月23日(現地時間)、コーディングエージェントの性能を評価する複合指標「Artificial Analysis Coding Agent Index v1.5」を更新した。この指標は、データカーブ (Datacurve) によるソフトウェアエンジニアリングタスクのDeepSWE v1.1、ロード・インスティチュート (Laude Institute) によるエージェントターミナル使用のTerminal-Bench 4.0、スケール・エーアイ (Scale AI) によるテクニカルQ&AのSWE-Atlas-QnAという3つの主要ベンチマークを統合している。実世界のソフトウェア開発タスクにおけるエージェントの実用的な性能測定を目指し、AnthropicやOpenAI、Meta、Googleなどの主要開発元からの20モデル中14のエージェントバリアントを評価対象としている。
更新されたArtificial Analysis Coding Agent Index v1.5は、3種類の異なる側面からコーディングエージェントの能力を包括的に測定する。
具体的には、データカーブ (Datacurve) が提供する113のソフトウェアエンジニアリングタスクで構成されるディープ・エスダブリューイー v1.1 (DeepSWE v1.1) は、コードの記述、デバッグ、リファクタリングなど、複雑なソフトウェア開発作業におけるエージェントの解決能力を評価する。次に、ロード・インスティチュート (Laude Institute) による66のタスクからなるターミナル・ベンチ 4.0 (Terminal-Bench 4.0) は、エージェントがターミナル環境をいかに効率的に操作し、コマンドラインツールを適切に使用できるかを測る。そして、スケール・エーアイ (Scale AI) が開発した124のタスクを含むエスダブリューイー・アトラス・キューアンドエー (SWE-Atlas-QnA) は、テクニカルな質問応答能力を通じて、エージェントの知識と問題解決スキルを検証する。
各ベンチマークのスコアは、タスクごとに3回の試行におけるpass@1の平均成功率に基づいて算出される。複合指数においては、これら3つのコンポーネントが均等に加重され、総合的な性能評価を可能にしている。指標では、タスクあたりの平均ウォールタイム、タスクあたりの平均APIコスト、トークン消費量、安全性に起因するタスク拒否率、リワードハッキング率といった多角的な側面からエージェントの性能が比較される。評価対象には、Anthropic、OpenAI、Meta、Googleなど、大手ベンダーのエージェントを含む、合計20モデル中14のエージェントバリアントが選定されている。
複合スコアは、多様なエージェントの迅速な性能比較に有用であるとされている。例えば、Artificial Analysis Coding Agent Index vs. Cost per Taskのようなグラフでは、性能が高く、かつタスクあたりのコストやトークン使用量が低いエージェントがMost attractive quadrant(最も魅力的な象限)として明確に示される。これにより、ユーザーは性能と経済性のバランスに優れたエージェントを効率的に特定できる。
参考: artificialanalysis.ai (アーカイブ) — 2026年9月24日 06:01 (JST)