Google DeepMindは2026年9月30日(現地時間)、新しいフロンティアモデル「Gemini 4 Argon」を発表した。同モデルはコーディング、エンタープライズ知識業務、サイバーセキュリティ防衛を主な用途とする。業界初となる最大1M出力トークンに対応し、複数のベンチマークで高い性能を示したものの、提供開始時点ではフェアウィンド・プログラム (Fairwind Program) の政府ユーザーと信頼できるサイバー防衛担当者のみがアクセス可能とされている。
Google DeepMindは、同モデルが19の信頼できるベンチマークのうち13で最先端 (SOTA) の性能を達成したと報告している。特に、DeepSWEでは77.9%を記録し、競合のGPT-6 Astraの74.1%やClaude Opus 5.5の74.2%を上回った。また、出力トークンを最大1Mに増加させる業界初のLong Decode Continuation機能も搭載された。
価格設定は1M入力トークンあたり4ドル、1M出力トークンあたり20ドル。導入割引が適用され、それぞれ2ドルと10ドルで提供される。Artificial Analysisによる評価では、インテリジェンス・インデックス (Intelligence Index) でGPT-6 Astraと同等の53を記録し、タスクあたりのコストは割引適用時で1.99ドルと算出されている。AA-Omniscienceにおける幻覚率は15%で、Astraの51%と比較して低いが、精度は50%と報告されている。
同社は、Gemini 4 Argonのエージェントがデータセンターメモリを300 TiB以上解放し、80万行以上のC/C++カーネルコードをRustへ移行していると報告した。Valsによる評価では、Vals Indexで68.9%を記録して1位を獲得し、Vibe Code Benchでは30のアプリを完璧に構築した。Terminal-Bench 4.0では57.6%、CyberBenchの概念実証タスクでは70%のスコアを達成している。
一方、OpenAIも関連する発表を行っている。GPT-6.1 SolがMathArenaで1位を獲得し、Code Arena WebDevでは3位に入った。また、OpenAIはGPT-6 Lunaの画像エンコーディングバグを修正し、DevDay Agent Stackとしてdots、Decisions API、コンピューター利用機能を導入した。Perplexityはコンテキスト埋め込みモデルpplx-embed-v2-context-9b-previewをHugging Faceで公開し、Cohereは埋め込みモデルEmbed 5を発表している。
参考: Latent Space (アーカイブ) — 2026年10月1日 15:45 (JST)