AIモデルの性能追跡サイト「Benchleader.com」は9月18日(現地時間)、週次リリース追跡ページを更新し、多数の新規モデルのベンチマーク結果を掲載しました。この更新では、DeepSeek V4 Flash、Gemini 3.8 Flash、Claude Opus 4など、新たに初期スコアが公開されたモデルや、複数のプロバイダーによるリリース予測が示されています。
Benchleaderは9月18日時点のデータに基づき、最新のベンチマーク情報を公開しました。今週新たにリストに加わったのは、インスティテュート・オブ・ファウンデーション・モデルズ (Institute of Foundation Models) が提供する「K2 Horizon 0.9B」「K2 Horizon 3.7B」「K2 Horizon 7B」K2 Horizon MoVA 36B A4Bの各モデルです。これらのモデルは全て、First results arrivingのステータスで初期のベンチマーク結果が掲載され始めています。また、サピエンス AI (Sapiens AI) の「Agnes 3.0 Flash」も、9月11日付の情報として同様にFirst results arrivingと記されています。
過去7日間にわたり最初のベンチマークスコアを公開したモデル群には、多岐にわたるプロバイダーの製品が含まれます。具体的には、Gemini 3.8 Flash, Muse Spark 1.3, DeepSeek V4 Flash, Claude Opus 4, Claude Sonnet 4, Gemma 4 26B A4B, GPT-5.2, Claude Fable 5.1, Qwen3 235B A22B, Llama 4 Maverick, Granite 3.3 8B, Gemini 3 Pro, o3, GPT-5, GPT-5.1, Grok 4, GPT-5 mini, o4-mini, Gemini 2.5 Pro, Claude Sonnet 4.5, GPT-5 nano, Grok 3 mini, Kimi K2といったモデルが名を連ねています。
個別のベンチマークスコアも詳細に示されており、例えばGemini 3.8 FlashはLMArena Agentで4.7ポイント、AA Intelligence Indexで40ポイント、GPQA Diamond (AA)で93.5%のスコアを記録しました。DeepSeek V4 FlashはAA Intelligence Indexで24.8ポイント、GPQA Diamond (AA)で86.7%の成績を示しています。これらのスコアは、各モデルの特定の性能指標における位置付けを明確にしています。
さらに、今回の更新では、今後のモデルリリース予測ウィンドウが提供者ごとに示されています。Amazon、Xiaomi、Mistral AI、Cohere、NVIDIA、Google、OpenAI、Meta、DeepSeek、Anthropicなどの主要企業が、将来的な新モデルのリリースを計画していることが示唆されています。一部のプロバイダーについては、予測されていたリリースウィンドウを過ぎており、「overdue」と表示されている状況です。
参考: benchleader.com (アーカイブ) — 2026年9月18日 09:00 (JST)