大規模言語モデルの予測能力を評価、FIFAワールドカップでリアルタイム検証
arXiv は2026年8月4日(現地時間)、論文「WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament」を公開した。同論文は、2026 FIFA ワールドカップの全104試合を対象に、6つの大規模言語モデル (LLMs) の予測能力を、リアルタイムかつデータリークなしで評価した研究について報告している。評価は各試合開始前に行われ、モデルの記憶による影響を排除。モデルは試合結果予測において平均63.9%の精度を示し、ブックメーカーの本命を支持するのと同水準だった。