arXiv cs.CLは2026年9月10日(現地時間)、論文「The Cost of Compression: A Rate-Distortion Limit on Factual Hallucination」を発表した。この研究は、閉鎖型質問応答 (closed-book question answering) における事実の幻覚が、情報の圧縮に起因する歪みによって生じる可能性を指摘する。従来の説とは異なり、モデル内部に事実が存在しても有限メモリによって近似的に保存される場合にエラーが発生する機構を提示する。

シー・ワン (Xi Wang) 氏、シージャ・シュー (Shijia Xu) 氏、ロンフェン・グオ (Rongfeng Guo) 氏が共同執筆した本論文は、情報圧縮が大規模言語モデル (LLM) における事実の幻覚に与える影響を深掘りする。

研究チームは、情報圧縮下での事実想起に関する単純なモデルを構築し、この現象のメカニズムを詳細に調査した。このモデルでは、N個の可能なクエリとK個の可能な回答を持つ非構造化質問応答タスクを想定している。学習者はまずM個の訓練事実を観測し、それらを最大Bビットに圧縮して記憶する。その後、外部検索メカニズムを使用せずに、一様に抽出されたテストクエリに回答を試みる。

このモデル設定において、均一なグラウンドトゥルースマッピングの条件下で、研究チームは特定の重要な不等式を証明した。この不等式は、観測された事実に対する圧縮による歪みと、未観測の事実に対するカバレッジの欠如という、幻覚の二つの異なる原因を明確に分離することを可能にする。

この理論的な境界は、LLMにおける選択的記憶、強制的な情報圧縮、内部構造、外部検索の必要性、不確実な回答の棄却、長文コンテキストの組織化といった複雑な側面を、コンパクトかつ統一的な方法で考察するための基盤を提供する。

理論的予測を検証するため、研究チームはシミュレーションを実施したほか、現代の言語モデルに対して制御された事実注入プローブを用いた実験も行った。これらの実験では、モデルの持つ事実負荷量と有効な訓練可能メモリ容量を意図的に変化させ、幻覚の発生パターンを分析した。

本研究は、事実の幻覚に関する包括的な理論を提供するものではないものの、有限メモリ下で観測された事実が失われることによる想起の失敗、という分離可能な失敗モードに対する情報理論的な説明を与えている。この知見は、LLMが情報をどのように記憶し処理するかの理解を深め、将来的な幻覚対策の研究に新たな視点を提供する。


参考: arXiv cs.CL — 2026年9月14日 13:00 (JST)

原文ハイライト

"The Cost of Compression: A Rate-Distortion Limit on Factual Hallucination"

この記事をシェア
X はてブ LinkedIn