リサーチ・論文 · 10月8日 20:18 arXiv、LLMの幻覚後推論を評価する新ベンチマーク「PHRBench」の論文公開 arXivは10月7日(現地時間)、大規模言語モデル (LLM) が生成した誤った情報(幻覚)が後続の推論に与える影響を評価する新しいベンチマーク「PHRBench」の論文を公開した。この研究は、幻覚情報が多段階のLLMシステム内で伝播し、その後の推論の文脈の一部となった際に、モデルがどのようにこの誤りを解決するのかを、応答レベルで詳細かつ構造的に評価することを目指している。