arena.aiは2026年7月21日(現地時間)、大規模言語モデル(LLM)の最新リーダーボード「LLM Leaderboard」を公開した。テキスト間タスクにおける378モデルを対象に、3,831,860票を超える人手評価投票に基づきランキングが決定されている。Anthropic の「claude-opus-4-6-thinking」が1516のスコアで首位を獲得した。
今回のリーダーボードでは、上位をアンスロピックのモデルが占める結果となった。claude-opus-4-6-thinkingに続き、「claude-fable-5」が1512、claude-opus-4-7-thinkingが1508、「claude-opus-4-6」が1507、「claude-opus-4-7」が1502のスコアで上位5モデルすべてを占めている。
6位にはMetaの「muse-spark-1.1」が1500で入り、OpenAIのgpt-5.6-sol-xhighは1494で8位に位置する。Googleのモデルでは「gemini-3-pro」が1489で10位、gemini-3.1-pro-previewが1488で12位にランクインした。また、Moonshotの「kimi-k3」が9位、Z.aiの「glm-5.1」が14位、Xiaomiの「mimo-v2.5-pro」が18位、SpaceXAIの「grok-4.20-beta1」が19位に名を連ねている。
これらのモデルは、数学、コーディング、クリエイティブライティング、その他のオープンエンド領域にわたるテキスト間タスクで評価された。各モデルには、ELOに相当するスコアと、評価に参加した投票数が表示されている。
参考: arena.ai — 2026年7月22日 09:00 (JST)
原文ハイライト"View overall rankings across various AI models in text-to-text tasks across math, coding"