Chao Wangは2026年9月15日(現地時間)、大規模言語モデル(LLM)の進捗評価におけるベンチマークの役割とその設計の変化を体系的に分析した研究論文をarXivに発表しました。この研究は、2022年1月から2026年8月にかけてarXivに投稿された、評価リソースを導入または更新する14,767本の論文を対象に実施されました。分析の結果、LLMの評価においては「action」「interaction」「professional applications」への重点が高まっていることが示されています。

この論文What Do We Expect from LLMs? Mapping the Design of LLM Benchmarksは、LLMのモデルランキングだけでは評価要件自体の変化が十分に明らかにならないという問題意識から、多様化するベンチマーク設計に焦点を当てています。

Chao Wangは、2022年1月から2026年8月までにarXivに提出された、評価リソースを導入または更新する14,767本の論文を系統的にマッピングし、段階的スクリーニングと自動全文コーディングを用いて分析しました。この分析では、ターゲットシステムとドメイン、評価材料と条件、採点メカニズムにおける変化が検証されています。

収集されたデータは、LLMの評価において「action」「interaction」professional applicationsへの重点がますます高まっていることを示しています。また、既存のデザイン要素と新しいデザイン要素が共存している状況も明らかになりました。モデルの参加状況には偏りが見られ、LLMベースの採点はエージェントグループと非エージェントグループの両方で増加していますが、モデル生成材料の持続的な増加は、最近のコホートでは確認されていません。

これらの発見は、公開研究が能力への期待を具体的なテストと成功基準にどのように変換しているかを明らかにしています。そして、AIがテストの構築、タスクの実行、応答の判断に参加するにつれて、評価の拡大がより独立した証拠を提供するのか、あるいは参加モデルの好みと死角を再現するリスクがあるのかという問いを提起しています。


参考: arXiv cs.AI (アーカイブ) — 2026年9月18日 13:00 (JST)

この記事をシェア
X はてブ LinkedIn