Artificial Analysis、MMLU-Proリーダーボードを公開
Artificial Analysisは6月(現地時間)、大規模言語モデルの新たな性能評価ベンチマーク「MMLU-Pro」のリーダーボードを公開しました。この評価では、Googleの「Gemini 3 Pro Preview (high)」が89.8%のスコアで首位を獲得しました。続いて、「Gemini 3 Pro Preview (low)」とAnthropicの「Claude Opus 4.5 (Reasoning)」が89.5%で同率2位となりました。MMLU-Proは、既存のMMLUベンチマークを拡張し、より深い推論能力を要求する形式が特徴です。