【速報】Hugging Face Blog、「BenchMIRT」を発表 LLMベンチマークの評価手法
Hugging Face Blogは2026年9月1日(現地時間)、LLM(大規模言語モデル)ベンチマークの測定対象を個々のプロンプトレベルで監査する新たな手法「BenchMIRT」を発表した。この手法は、モデルのスコアを駆動する基盤となる能力を特定することを目的とする。
Tag
28 件の関連記事
Hugging Face Blogは2026年9月1日(現地時間)、LLM(大規模言語モデル)ベンチマークの測定対象を個々のプロンプトレベルで監査する新たな手法「BenchMIRT」を発表した。この手法は、モデルのスコアを駆動する基盤となる能力を特定することを目的とする。
BenchLM.aiは9月1日(現地時間)、ソフトウェアエンジニアリング作業の評価ベンチマーク「SWE-bench Pro」の最新リーダーボードを公開しました。Anthropicの「Claude Fable 5.1」が81.2%のスコアで首位を獲得し、「Claude Mythos 5」が80.3%で2位、「Claude Fable 5」が80%で3位に続いています。今回の更新では、合計67モデルの評価結果が示されています。
Together AIは2026年8月21日(現地時間)、ソフトウェアエンジニアリング能力を評価するベンチマーク「DeepSWE」を用いて、同社のモデルであるGLM-5.3とClaude Fable 5の比較評価結果を公開しました。この評価により、両モデルのpass@1スコアはほぼ同等であるものの、複数回試行を許容するpass@kの指標ではGLM-5.3が優位に立ち、かつロールアウトあたりのコストがClaude Fable 5より大幅に低いことが明らかになりました。
Together AI(トゥゲザーエーアイ)は2026年8月21日(現地時間)、同社のブログ記事を通じて、大規模言語モデル「GLM-5.3(ジーエルエム5.3)」と「GPT-5.6 Sol(ジーピーティー5.6ソル)」を、ソフトウェアエンジニアリングベンチマーク「DeepSWE(ディープスウィー)」で比較した結果を公開した。この検証では、単一試行におけるGPT-5.6 Solの優位性と、複数試行および費用対効果におけるGLM-5.3の強みが明らかになった。さらに、両者を組み合わせたカスケード方式が、性能と費用効率の双方で最も優れた結果を示すことが示された。
ディープシーク(DeepSeek)は2026年8月13日(現地時間)、フラッグシップAIモデル「DeepSeek-V4-Pro-0813」のアップデート版をリリースしました。このモデルは、一部の開発者から全体的な性能と価格設定に関して不満の声が上がる一方、サイバーセキュリティのようなニッチな分野では研究者から高い評価を受けています。以前のV4 Flashモデルがその極端なコスト効率で注目されたのとは対照的に、今回の主力モデルは汎用ベンチマークにおいて競合他社に及ばない結果を示しています。
アーティフィシャル・アナリシス (Artificial Analysis) は2026年8月12日(現地時間)、AIモデルのカスタムベンチマーク作成プラットフォーム「Optima(オプティマ)」をローンチしたと発表した。同プラットフォームは、ユーザーが自身のファイルやエージェントトレース、コーディング環境から独自のベンチマークを構築し、主要なAIモデル間で品質、タスクあたりのコスト、タスクあたりの時間を比較することを可能にする。これにより、特定のユースケースに最適なモデルや、現在の設定と比較して最大10倍のコスト削減が可能な代替モデルの特定を支援する。
arXiv cs.AIは7月30日(現地時間)、コンピュータ利用エージェント(CUA)の評価に用いられるビジョン言語モデル(VLM)の信頼性を体系的に評価する新しいベンチマーク「OSリワード (OSReward)」を発表した。この包括的な評価の結果、最先端のVLMでも理想的な評価者には及ばず、失敗した実行を成功と誤認する「寛大さバイアス」を持つことが指摘された。また、信頼性の高いVLMはコストが高く、手頃な価格のオープンモデルは性能が大幅に劣る現状も浮き彫りになった。
デンジェ・ホウ (Dengzhe Hou) 氏らは2026年7月27日(現地時間)、学術誌arXiv cs.CLで論文「コグアリーナ (CogArena)」を発表した。この研究は、大規模言語モデル (LLM) の認知能力構造を多角的に評価するための新たなベンチマーク「CogArena」を導入。手続き的に生成された13のパラダイムと5つの理論に基づいたグループ分けを中心に、55のオープンウェイトモデルおよび6つのファミリーに属する12モデルを対象に評価を実施した結果、安定した5次元の認知プロファイルが確立されていない可能性が示された。
Hao Liang (ハオ・リャン) 氏らは7月28日(現地時間)、エンタープライズエージェントが複数の知識ソースを統合する能力を評価する新たなベンチマーク「WorkSurface-Bench (ワークサーフェス・ベンチ)」を発表した。arXiv cs.CLで公開されたこのベンチマークは、文書、表、グラフといった異なる「サーフェス」からの情報選択能力を測定することを目的とし、1,151の個別タスクで構成されている。
Together AIは2026年7月25日(現地時間)付けのブログ記事で、大規模言語モデルKimi K3とGPT-5.6 SolのDeepSWEベンチマークにおける性能比較結果を発表した。単一試行での解決率(pass@1)ではGPT-5.6 Solが72.7%でKimi K3の68.5%を上回ったが、複数試行での解決率(pass@k with k > 1)ではKimi K3が優位性を示した。
Hugging Faceは2026年7月14日(現地時間)、音声AIの人間的な品質を評価する新たなベンチマーク「Real World VoiceEQ」を発表した。このベンチマークは、既存の評価基準が捉えきれない現実世界での会話における音声AIの性能ギャップに対処するために開発された。
ベンチエルエム・エーアイ (benchlm.ai) は2026年7月9日(現地時間)、ディープシーク (DeepSeek) が開発したオープンウェイトモデル「DeepSeek V4 Pro (Max)」の最新ベンチマークデータを公開しました。同モデルは暫定リーダーボードで79モデル中14位、総合スコア78/100を記録。特に「Coding」カテゴリで高い性能を示し、最長1Mトークンの広範なコンテキストウィンドウが特徴です。
Artificial Analysisは7月6日(現地時間)、ZapierのAutomationBenchに対する独立した評価指標「AutomationBench-AA」を発表した。このベンチマークは、AIエージェントが実際のSaaSワークフローをビジネスルールを遵守しつつ自動化できるかを評価する。AnthropicのClaude Fable 5が48.6%、Opus 4.8が48.5%でトップスコアを記録。Google DeepMindのGemini 3.5 Flashが42.6%、OpenAIのGPT-5.5 (xhigh)が42.1%で続いた。
Anthropicは2026年6月30日(現地時間)、同社ミドルティアモデルの最新版「Claude Sonnet 5」を発表した。前モデルSonnet 4.6の全ベンチマークスコアを上回り、特にエージェント性能と長時間のタスク実行における信頼性が向上したとされている。最上位モデルOpus 4.8と比較しても性能差を縮めつつ、API価格を低く設定することで費用対効果を最適化した。
lmcouncil.ai (エルエムカウンシル・ドット・エーアイ) は6月(現地時間)、最新のAIモデル比較結果「AI Model Benchmarks Jun 2026」を公開した。このベンチマークは、GPT-5.5やClaude Opus、Geminiシリーズなど複数の主要AIモデルを対象とし、多様な性能評価を集約している。報告書は各モデルが異なる強みを持つことを示しており、AI市場における性能競争の現状を浮き彫りにした。
Epoch AIは2026年6月26日(現地時間)、長時間にわたるAIのコーディング能力を評価するための新たなベンチマーク「MirrorCode」を発表する論文を公開した。このベンチマークは、AIが元のソースコードにアクセスせずにプログラム全体をエンドツーエンドで再実装する能力を測定する目的で設計されており、数週間に及ぶコーディングタスクの実行可能性を示している。
GLM-5.2は6月22日(現地時間)、Don't Worry About the Vase (Zvi)が報じたところによると、その登場以来、優れたベンチマークスコアを示し、最も強力なオープンモデルの可能性があると指摘されている。GLM-5.1からの大幅な進歩を遂げたものの、最先端のフロンティアモデルには及ばない側面がある。しかし、そのコストパフォーマンスはパレートフロンティア上に位置すると評価されている。
Hugging Face Blogは2026年6月18日(現地時間)、エージェントが多様なツールを効果的に活用するための新たなベンチマーク手法に関する記事を発表した。同社はこの評価のため、「ハーネス」と称するツールを導入。これは、エージェントが特定のタスクを達成するまでに要する作業量を詳細に計測するもので、人気ライブラリ「transformers」をケーススタディとして採用している。評価は、オープンモデルと専門のコーディングエージェントによって推進され、Hugging Face Jobs上で並列実行される。
OpenAIは6月17日(現地時間)、AIシステムが実際のライフサイエンス研究タスクと意思決定を処理する能力を評価するための新たなベンチマーク「LifeSciBench」を発表した。専門家によって作成・レビューされたこのベンチマークは、従来の評価方法では捉えきれなかった複雑な研究能力を測定することを目指し、AIが生命科学分野での実用的な共同研究者となる可能性を探る上で重要な一歩と位置づけられる。
Sicheng Yangらは2026年6月12日(現地時間)、医療用マルチモーダル大規模言語モデル (MLLM) の推論過程における幻覚を段階的に診断する新たなベンチマーク「ClinHallu」を発表した。既存の医療分野における幻覚ベンチマークがデータ収集に主眼を置いていたのに対し、ClinHalluは幻覚の発生源を「Visual Recognition (視覚認識)」「Knowledge Recall (知識想起)」「Reasoning Integration (推論統合)」の3段階に分解し、詳細な原因特定を可能にする。
arXiv cs.CLは2026年6月9日(現地時間)、大規模言語モデル(LLM)の出力における目標条件付きの情報歪みを測定する新たなベンチマーク「JANUS」を発表した。これは、従来のLLMの欺瞞評価が偽造された主張や明白な虚偽に焦点を当てていたのに対し、現実世界で頻繁に見られる、真実の事実を選択的に用いることで生じる誤解を招くコミュニケーションを検出する。JANUSは、このようなより巧妙な情報操作を特定するために設計されており、既存のベンチマークでは捉えきれなかった側面を評価対象とする。
arXiv(アーカイブ)cs.AIは2026年6月8日(現地時間)、AI(人工知能)評価結果の報告における一貫性の欠如を指摘し、この課題に対処するための運用可能なレポート層「EvalCards(評価カード)」を提案する論文を発表した。同論文は、評価結果の比較困難さや情報欠落の問題を解決するため、ベンチマークメタデータ、評価実行データ、モデルメタデータを統一された記録に統合する仕組みを詳述しており、AI評価報告の透明性と信頼性向上に寄与すると期待される。
ヴィクター・ミューリン (Victor Muryn) 氏らの研究チームは6月4日(現地時間)、macOS環境でコンピュータ使用エージェント (Computer-use agents: CUAs) を評価するための新しいベンチマーク「MacArena」を導入したと発表した。同日付けで学術論文プレプリントサーバarXiv cs.LGに報じられた。既存のmacOS向けベンチマークが対応アプリケーションやタスク範囲が限定的であり、Apple Siliconとの互換性がないといった課題を解決し、より包括的な評価基準を提示する。
arXiv cs.AIは2026年6月3日(現地時間)、AIエージェントの長時間タスク性能を測る新オープンソースベンチマーク「SentinelBench (SentinelBench)」が発表されたと報じた。従来のAIエージェントが連続的アクションに焦点を当てる中、SentinelBenchは、環境を監視し、外部イベントに持続的に対応する戦略を評価する。これにより、タスク完了率、反応時間、リソース使用量といった多角的な指標に基づき、応答性とコストのトレードオフを効率的に評価できる。
科学論文リポジトリarXivのコンピューターサイエンス分野 (cs.AI) が2026年6月1日(現地時間)、大規模言語モデル (LLM) を指導医として評価する新たな対話型ベンチマーク「ClinEnv (クリンエンブ)」を発表した。このベンチマークは、実際の入院患者の症例データに基づき、複数段階の意思決定プロセスを経て、モデルが情報収集を行い、投薬、処置、診断を行う能力を評価する。モデルの決定内容と情報収集プロセス双方をスコア化する点が特徴となっている。
Hugging Face Blogが2026年5月27日(現地時間)付けで報じたところによると、Artificial AnalysisとIBM Software Innovation Labはエージェント型エンタープライズITタスク向けの新ベンチマークシリーズ第一弾「ITBench-AA」を発表した。初期のSite Reliability Engineering (SRE) タスクにおいて、最先端のモデルでもスコアは50%を下回った。
Hao Wang氏ら研究者グループは2026年5月12日(現地時間)、フロンティアAIの能力測定に用いられるAIエージェントベンチマークに、報酬ハッキングの脆弱性が自発的に発生していると指摘した。この脆弱性を体系的に監査するため、研究チームは自動レッドチーミングシステム「BenchJack(ベンチジャック)」を開発。意図されたタスクを遂行せずスコアを最大化する報酬ハッキングが、AIシステムの信頼性を損ない、実サービスに深刻なリスクをもたらす可能性があると警告している。
arXiv cs.CLは5月11日(現地時間)、Shuangrui Ding氏らが、大規模言語モデル (LLM) およびビジョン言語モデル (VLM) を活用するエージェントの実環境での長期的な性能を評価するための新たなベンチマーク「WildClawBench」を発表した。このベンチマークは、実際のCLI環境下で実ツールにアクセスし、タスクを遂行するエージェントの能力を測定する。人間が作成した60のバイリンガルかつマルチモーダルなタスクで構成され、各タスクは平均8分の実行時間と20以上のツール呼び出しを含む。