ベンダー・製品

【速報】Hugging Face Blog、「BenchMIRT」を発表 LLMベンチマークの評価手法

Hugging Face Blogは2026年9月1日(現地時間)、LLM(大規模言語モデル)ベンチマークの測定対象を個々のプロンプトレベルで監査する新たな手法「BenchMIRT」を発表した。この手法は、モデルのスコアを駆動する基盤となる能力を特定することを目的とする。

ベンダー・製品

Anthropic「Claude Fable 5.1」がSWE-bench Proで首位

BenchLM.aiは9月1日(現地時間)、ソフトウェアエンジニアリング作業の評価ベンチマーク「SWE-bench Pro」の最新リーダーボードを公開しました。Anthropicの「Claude Fable 5.1」が81.2%のスコアで首位を獲得し、「Claude Mythos 5」が80.3%で2位、「Claude Fable 5」が80%で3位に続いています。今回の更新では、合計67モデルの評価結果が示されています。

ベンダー・製品

Together AI、DeepSWEでGLM-5.3とClaude Fable 5を比較評価:性能とコストで分析

Together AIは2026年8月21日(現地時間)、ソフトウェアエンジニアリング能力を評価するベンチマーク「DeepSWE」を用いて、同社のモデルであるGLM-5.3とClaude Fable 5の比較評価結果を公開しました。この評価により、両モデルのpass@1スコアはほぼ同等であるものの、複数回試行を許容するpass@kの指標ではGLM-5.3が優位に立ち、かつロールアウトあたりのコストがClaude Fable 5より大幅に低いことが明らかになりました。

ベンダー・製品

Together AI、DeepSWEでGLM-5.3とGPT-5.6 Solを比較 – 性能と費用対効果を検証

Together AI(トゥゲザーエーアイ)は2026年8月21日(現地時間)、同社のブログ記事を通じて、大規模言語モデル「GLM-5.3(ジーエルエム5.3)」と「GPT-5.6 Sol(ジーピーティー5.6ソル)」を、ソフトウェアエンジニアリングベンチマーク「DeepSWE(ディープスウィー)」で比較した結果を公開した。この検証では、単一試行におけるGPT-5.6 Solの優位性と、複数試行および費用対効果におけるGLM-5.3の強みが明らかになった。さらに、両者を組み合わせたカスケード方式が、性能と費用効率の双方で最も優れた結果を示すことが示された。

ベンダー・製品

ディープシーク、AIモデル「V4 Pro」更新も汎用ベンチマークで苦戦 — サイバーセキュリティでは評価

ディープシーク(DeepSeek)は2026年8月13日(現地時間)、フラッグシップAIモデル「DeepSeek-V4-Pro-0813」のアップデート版をリリースしました。このモデルは、一部の開発者から全体的な性能と価格設定に関して不満の声が上がる一方、サイバーセキュリティのようなニッチな分野では研究者から高い評価を受けています。以前のV4 Flashモデルがその極端なコスト効率で注目されたのとは対照的に、今回の主力モデルは汎用ベンチマークにおいて競合他社に及ばない結果を示しています。

リサーチ・論文

アーティフィシャル・アナリシス、AIモデル評価の新プラットフォーム「Optima」を提供開始

アーティフィシャル・アナリシス (Artificial Analysis) は2026年8月12日(現地時間)、AIモデルのカスタムベンチマーク作成プラットフォーム「Optima(オプティマ)」をローンチしたと発表した。同プラットフォームは、ユーザーが自身のファイルやエージェントトレース、コーディング環境から独自のベンチマークを構築し、主要なAIモデル間で品質、タスクあたりのコスト、タスクあたりの時間を比較することを可能にする。これにより、特定のユースケースに最適なモデルや、現在の設定と比較して最大10倍のコスト削減が可能な代替モデルの特定を支援する。

リサーチ・論文

OSRewardベンチマーク発表、VLM評価の信頼性課題浮き彫り

arXiv cs.AIは7月30日(現地時間)、コンピュータ利用エージェント(CUA)の評価に用いられるビジョン言語モデル(VLM)の信頼性を体系的に評価する新しいベンチマーク「OSリワード (OSReward)」を発表した。この包括的な評価の結果、最先端のVLMでも理想的な評価者には及ばず、失敗した実行を成功と誤認する「寛大さバイアス」を持つことが指摘された。また、信頼性の高いVLMはコストが高く、手頃な価格のオープンモデルは性能が大幅に劣る現状も浮き彫りになった。

リサーチ・論文

デンジェ・ホウ氏ら、LLM認知能力のベンチマーク「コグアリーナ」を発表

デンジェ・ホウ (Dengzhe Hou) 氏らは2026年7月27日(現地時間)、学術誌arXiv cs.CLで論文「コグアリーナ (CogArena)」を発表した。この研究は、大規模言語モデル (LLM) の認知能力構造を多角的に評価するための新たなベンチマーク「CogArena」を導入。手続き的に生成された13のパラダイムと5つの理論に基づいたグループ分けを中心に、55のオープンウェイトモデルおよび6つのファミリーに属する12モデルを対象に評価を実施した結果、安定した5次元の認知プロファイルが確立されていない可能性が示された。

ベンダー・製品

【速報】Hugging Face、音声AIの人間品質評価ベンチマーク「Real World VoiceEQ」を発表

Hugging Faceは2026年7月14日(現地時間)、音声AIの人間的な品質を評価する新たなベンチマーク「Real World VoiceEQ」を発表した。このベンチマークは、既存の評価基準が捉えきれない現実世界での会話における音声AIの性能ギャップに対処するために開発された。

リサーチ・論文

Artificial Analysis、AIエージェント評価「AutomationBench-AA」発表

Artificial Analysisは7月6日(現地時間)、ZapierのAutomationBenchに対する独立した評価指標「AutomationBench-AA」を発表した。このベンチマークは、AIエージェントが実際のSaaSワークフローをビジネスルールを遵守しつつ自動化できるかを評価する。AnthropicのClaude Fable 5が48.6%、Opus 4.8が48.5%でトップスコアを記録。Google DeepMindのGemini 3.5 Flashが42.6%、OpenAIのGPT-5.5 (xhigh)が42.1%で続いた。

リサーチ・論文

アンソロピック、新モデル「Claude Sonnet 5」発表 - エージェント性能と費用対効果を大幅強化

Anthropicは2026年6月30日(現地時間)、同社ミドルティアモデルの最新版「Claude Sonnet 5」を発表した。前モデルSonnet 4.6の全ベンチマークスコアを上回り、特にエージェント性能と長時間のタスク実行における信頼性が向上したとされている。最上位モデルOpus 4.8と比較しても性能差を縮めつつ、API価格を低く設定することで費用対効果を最適化した。

リサーチ・論文

Epoch AI、長時間コーディングベンチマーク「MirrorCode」を論文発表

Epoch AIは2026年6月26日(現地時間)、長時間にわたるAIのコーディング能力を評価するための新たなベンチマーク「MirrorCode」を発表する論文を公開した。このベンチマークは、AIが元のソースコードにアクセスせずにプログラム全体をエンドツーエンドで再実装する能力を測定する目的で設計されており、数週間に及ぶコーディングタスクの実行可能性を示している。

リサーチ・論文

GLM-5.2、ベンチマークで高い性能を発揮、新たなオープンモデルとして注目

GLM-5.2は6月22日(現地時間)、Don't Worry About the Vase (Zvi)が報じたところによると、その登場以来、優れたベンチマークスコアを示し、最も強力なオープンモデルの可能性があると指摘されている。GLM-5.1からの大幅な進歩を遂げたものの、最先端のフロンティアモデルには及ばない側面がある。しかし、そのコストパフォーマンスはパレートフロンティア上に位置すると評価されている。

リサーチ・論文

医療用MLLM推論の段階的幻覚診断ベンチマーク「ClinHallu」発表

Sicheng Yangらは2026年6月12日(現地時間)、医療用マルチモーダル大規模言語モデル (MLLM) の推論過程における幻覚を段階的に診断する新たなベンチマーク「ClinHallu」を発表した。既存の医療分野における幻覚ベンチマークがデータ収集に主眼を置いていたのに対し、ClinHalluは幻覚の発生源を「Visual Recognition (視覚認識)」「Knowledge Recall (知識想起)」「Reasoning Integration (推論統合)」の3段階に分解し、詳細な原因特定を可能にする。

リサーチ・論文

arXiv、AI評価結果報告の新基準「EvalCards」を論文で提案

arXiv(アーカイブ)cs.AIは2026年6月8日(現地時間)、AI(人工知能)評価結果の報告における一貫性の欠如を指摘し、この課題に対処するための運用可能なレポート層「EvalCards(評価カード)」を提案する論文を発表した。同論文は、評価結果の比較困難さや情報欠落の問題を解決するため、ベンチマークメタデータ、評価実行データ、モデルメタデータを統一された記録に統合する仕組みを詳述しており、AI評価報告の透明性と信頼性向上に寄与すると期待される。

リサーチ・論文

macOS向け新ベンチマーク「MacArena」公開、CUA評価の課題解決へ

ヴィクター・ミューリン (Victor Muryn) 氏らの研究チームは6月4日(現地時間)、macOS環境でコンピュータ使用エージェント (Computer-use agents: CUAs) を評価するための新しいベンチマーク「MacArena」を導入したと発表した。同日付けで学術論文プレプリントサーバarXiv cs.LGに報じられた。既存のmacOS向けベンチマークが対応アプリケーションやタスク範囲が限定的であり、Apple Siliconとの互換性がないといった課題を解決し、より包括的な評価基準を提示する。

リサーチ・論文

AIエージェントの報酬ハッキング脆弱性を自動監査、新システム「BenchJack」開発

Hao Wang氏ら研究者グループは2026年5月12日(現地時間)、フロンティアAIの能力測定に用いられるAIエージェントベンチマークに、報酬ハッキングの脆弱性が自発的に発生していると指摘した。この脆弱性を体系的に監査するため、研究チームは自動レッドチーミングシステム「BenchJack(ベンチジャック)」を開発。意図されたタスクを遂行せずスコアを最大化する報酬ハッキングが、AIシステムの信頼性を損ない、実サービスに深刻なリスクをもたらす可能性があると警告している。

リサーチ・論文

WildClawBench、LLM/VLMエージェントの長期評価ベンチマークを公開

arXiv cs.CLは5月11日(現地時間)、Shuangrui Ding氏らが、大規模言語モデル (LLM) およびビジョン言語モデル (VLM) を活用するエージェントの実環境での長期的な性能を評価するための新たなベンチマーク「WildClawBench」を発表した。このベンチマークは、実際のCLI環境下で実ツールにアクセスし、タスクを遂行するエージェントの能力を測定する。人間が作成した60のバイリンガルかつマルチモーダルなタスクで構成され、各タスクは平均8分の実行時間と20以上のツール呼び出しを含む。