LLMベンチマーク設計変遷を分析 評価要件の変化詳述
Chao Wangは2026年9月15日(現地時間)、大規模言語モデル(LLM)の進捗評価におけるベンチマークの役割とその設計の変化を体系的に分析した研究論文をarXivに発表しました。この研究は、2022年1月から2026年8月にかけてarXivに投稿された、評価リソースを導入または更新する14,767本の論文を対象に実施されました。分析の結果、LLMの評価においては「action」「interaction」「professional applications」への重点が高まっていることが示されています。