Artificial Analysis、AIエージェント指標v1.5更新
Artificial Analysisは9月23日(現地時間)、コーディングエージェントの性能を評価する複合指標「Artificial Analysis Coding Agent Index v1.5」を更新した。この指標は、データカーブ (Datacurve) によるソフトウェアエンジニアリングタスクのDeepSWE v1.1、ロード・インスティチュート (Laude Institute) によるエージェントターミナル使用のTerminal-Bench 4.0、スケール・エーアイ (Scale AI) によるテクニカルQ&AのSWE-Atlas-QnAという3つの主要ベンチマークを統合している。実世界のソフトウェア開発タスクにおけるエージェントの実用的な性能測定を目指し、AnthropicやOpenAI、Meta、Googleなどの主要開発元からの20モデル中14のエージェントバリアントを評価対象としている。