大規模言語モデルの社会世界予測、新ベンチマーク「SocietyBench」が登場
arXiv cs.CLは8月4日(現地時間)、大規模言語モデル (LLM) の社会イベント予測能力を評価する新たなベンチマーク「SocietyBench」を導入する研究論文を発表しました。このベンチマークは、現実世界のニュースやソーシャルメディアの投稿から事実と世論を分離した時系列データを生成し、モデルに反事実的な社会世界の進化を予測させます。既存のLLMは一般的なタスク遂行能力では高い評価を得ていますが、社会イベントの深い理解と将来予測に関する能力はこれまで十分に測定されていませんでした。