大規模言語モデルの「認識的近視」を指摘、新ベンチマーク「ElephantBench」導入
Zhuoshi Pan氏らは2026年8月28日(現地時間)、大規模言語モデル (LLM) がロングテールな事実に関する相反する記述を保持する能力を評価するため、「ElephantBench」という新たなクローズドブック知識プローブを導入した。この研究は、LLMが多様な情報源から得られた知識をどの程度完全に統合できるかについて、現状の課題を浮き彫りにしている。従来の質問応答システムでは捉えきれなかったLLMの認識的近視を診断することが目的だ。