ジェンルー・シェン氏は2026年9月29日(現地時間)、大規模言語モデル(LLM)によるグラフ再構築における歪みに関する新たなスペクトル理論を発表した。この研究では、グラフ再構築で生じる歪みを評価するため、ラプラシアンスペクトルのワッサースタイン距離が、エッジ数の純変化と対称差により制約されることを示した。この理論は、集約された歪みのみでは再構築の具体的な編集ポリシーが不明瞭になる可能性を指摘している。

この分析は、LLMによるグラフ再構築の評価で通常用いられる、元のグラフと再構築されたグラフ間の単一の集約距離に着目した。シェン氏は、ラプラシアンスペクトルのワッサースタイン距離が、2つのエッジカウントにより制約されることを証明した。具体的には、下限としてエッジ数の純変化、上限として対称差が適用され、それぞれ頂点数 $n$ に対して $2/n$ でスケーリングされる。

この制約は厳密であり、再構築がエッジの追加のみ、または削除のみを行った場合には、この距離がスケーリングされたエッジカウントと正確に一致し、変化したエッジの具体的な情報は得られない。両端が一致しない、すなわち距離と下限の残差が正となるのは、再構築がエッジの作成と消失の両方を行った場合のみである。この事実は、報告された要約値だけでは把握できない混合編集の発生を示唆している。

シェン氏は、45の合成グラフに対して3つのオープンウェイトモデルが生成した135の再構築を分析し、上記のメカニズムを検証した。分析の結果、77の出力はエッジの片側編集であり、29の混合編集出力では $X > 0$ を示した。これらの混合編集には、エッジ数が正確に維持されながらも、19のエッジが同時に作成され、同時に消失したケースも含まれていた。3つのモデルはそれぞれ異なる編集ポリシーを示し、入力の忠実なコピーから、大量の幻覚(hallucination)を伴う補完まで多岐にわたった。この編集ポリシーの違いは、集約された歪みからは判別できないことが明らかになった。


参考: arXiv cs.LG (アーカイブ) — 2026年9月30日 02:59 (JST)

原文ハイライト

"A Spectral Theory of Distortion in LLM Graph Reconstruction"

この記事をシェア
X はてブ LinkedIn