ベンダー・製品

【速報】Hugging Face Blog、「BenchMIRT」を発表 LLMベンチマークの評価手法

Hugging Face Blogは2026年9月1日(現地時間)、LLM(大規模言語モデル)ベンチマークの測定対象を個々のプロンプトレベルで監査する新たな手法「BenchMIRT」を発表した。この手法は、モデルのスコアを駆動する基盤となる能力を特定することを目的とする。

ベンダー・製品

アレンAI、AIチューターの支援判断フレームワーク「TutorMoments」プレビュー公開

AllenAIは2026年8月6日(現地時間)、AIチューターが学生を支援すべきか、あるいは学生自身に考えさせるべきかという教育における判断のバランスを測定するフレームワーク「TutorMoments」のプレビュー版を公開した。TutorMomentsは、実際の1対1の数学チュータリングセッションの記録に基づいたリプレイ評価システムで、経験豊富な数学教師が学生の理解を深めるための重要な瞬間にチューターが下すべき決定を特定する。これにより、LLMがチューターとして適切な支援を行うかを評価する。

ベンダー・製品

Hugging Face、AllenAIのDiScoFormerを発表—高次元データ密度・スコアを一元推定

Hugging Face Blogは6月29日(現地時間)、AllenAIが開発した新しいモデル「DiScoFormer (Density and Score Transformer)」を発表しました。この革新的なモデルは、単一のトランスフォーマーモデルがデータ点から分布の密度とスコアの両方を、再学習なしの単一のフォワードパスで効率的に推定することを可能にします。これにより、高次元データの複雑な確率分布モデリングに新たな道を開くことが期待されています。

ベンダー・製品

EMO: 事前学習でモジュール性が創発するMoEモデル発表

Allen Institute for AIは2026年5月8日(現地時間)、人間が定義した事前知識に頼らず、データから直接モジュール構造が創発するよう事前学習された新しい専門家混合 (MoE) モデル「EMO」を公開した。EMOは、特定のタスクにおいて総専門家のわずか12.5%を使用するだけでほぼフルモデルの性能を維持できる。同時に、全専門家を使用する際には強力な汎用モデルとしても機能する。