【速報】Hugging Face Blog、「BenchMIRT」を発表 LLMベンチマークの評価手法
Hugging Face Blogは2026年9月1日(現地時間)、LLM(大規模言語モデル)ベンチマークの測定対象を個々のプロンプトレベルで監査する新たな手法「BenchMIRT」を発表した。この手法は、モデルのスコアを駆動する基盤となる能力を特定することを目的とする。
Tag
5 件の関連記事
Hugging Face Blogは2026年9月1日(現地時間)、LLM(大規模言語モデル)ベンチマークの測定対象を個々のプロンプトレベルで監査する新たな手法「BenchMIRT」を発表した。この手法は、モデルのスコアを駆動する基盤となる能力を特定することを目的とする。
AllenAIは2026年8月6日(現地時間)、AIチューターが学生を支援すべきか、あるいは学生自身に考えさせるべきかという教育における判断のバランスを測定するフレームワーク「TutorMoments」のプレビュー版を公開した。TutorMomentsは、実際の1対1の数学チュータリングセッションの記録に基づいたリプレイ評価システムで、経験豊富な数学教師が学生の理解を深めるための重要な瞬間にチューターが下すべき決定を特定する。これにより、LLMがチューターとして適切な支援を行うかを評価する。
Hugging Face Blogは6月29日(現地時間)、AllenAIが開発した新しいモデル「DiScoFormer (Density and Score Transformer)」を発表しました。この革新的なモデルは、単一のトランスフォーマーモデルがデータ点から分布の密度とスコアの両方を、再学習なしの単一のフォワードパスで効率的に推定することを可能にします。これにより、高次元データの複雑な確率分布モデリングに新たな道を開くことが期待されています。
Allen Institute for AI (AllenAI) は2026年6月12日(現地時間)、大規模言語モデル (LLM) 開発向けの新しい評価ワークベンチ「olmo-eval」を公開した。olmo-evalは、同組織が2024年に導入したOpen Language Model Evaluation Standard (OLMES) を基盤とし、LLMの継続的な開発サイクル全体にわたる評価プロセスを効率化する。これにより、データやアーキテクチャの変更に伴うモデルの振る舞いを追跡する作業が簡素化される。
Allen Institute for AIは2026年5月8日(現地時間)、人間が定義した事前知識に頼らず、データから直接モジュール構造が創発するよう事前学習された新しい専門家混合 (MoE) モデル「EMO」を公開した。EMOは、特定のタスクにおいて総専門家のわずか12.5%を使用するだけでほぼフルモデルの性能を維持できる。同時に、全専門家を使用する際には強力な汎用モデルとしても機能する。