arXiv cs.CLは9月27日(現地時間)、論文を公開し、リトリーバル拡張生成 (RAG) における主張の事実性確保が課題であることを指摘しました。特に、複数の依存ステップを経て情報を取得・推論するマルチホップRAGでは、外部情報源からのコンテキストが必ずしも事実を保証しない問題が顕著です。同論文では、RAG向けに開発された主張レベルの適合性に基づく事実性制御がマルチホップRAGにも有効であるかを検証しました。
リトリーバル拡張生成 (RAG) は、大規模言語モデル (LLM) が外部の知識源を参照することで、より正確で根拠に基づいた回答を生成する手法として注目されています。しかし、RAGが参照する外部コンテキストが不正確であったり、LLMがコンテキストから逸脱した「ハルシネーション」を生成したりするリスクは依然として存在します。この問題は、特に複数の情報源を段階的に参照・統合するマルチホップRAGにおいて深刻化します。マルチホップRAGでは、最初のホップで取得した情報が次のホップのクエリに影響を与えるため、途中のステップで誤りが生じると、最終的な回答の事実性が大きく損なわれる可能性があります。
Muhammad Aimal Rehman氏とChi-Kuang Yeh氏によるこの研究は、このようなマルチホップRAGにおける事実性確保の課題に対し、スプリット適合性主張フィルタリングという手法の適用可能性を評価しました。この手法は、適合性理論 (Conformal Prediction) に基づき、生成された各主張が所与のコンテキストによってどの程度サポートされているかを統計的に検証し、信頼水準を満たさない主張をフィルタリングすることで、回答全体の事実性を向上させることを目指します。
研究では、このアプローチをマルチホップRAGに適用し、その有効性を検証するために詳細な実験が実施されました。評価には、複雑な多段階推論を要する質問応答データセットであるHotpotQAに加えて、Natural Questions、TriviaQAといった複数のデータセットが用いられました。大規模言語モデルとしては、高い性能で知られるLlama 3.1 8BとGPT-4o-miniが使用され、これらのモデルが生成する応答の事実性がスプリット適合性主張フィルタリングによってどの程度改善されるかが分析されました。比較のために、単一ホップRAGのシナリオにおける参照実験も同時に行われ、マルチホップの複雑性に対する手法の堅牢性が評価されました。
実験の結果、適合性に基づく厳格な事実性目標を設定するほど、フィルタリング後に残された主張が完全にサポートされる応答の割合が、一貫して増加することが確認されました。例えば、95%の適合性目標を適用した場合、応答中の事実に基づかない主張が大幅に減少し、この割合はフィルタリングなしの55.60%〜76.03%と比較して、95.80%〜97.20%という高い水準に向上しました。これは、適合性に基づく制御が、生成される情報の信頼性を劇的に高める潜在力を持つことを示唆しています。
しかしながら、この顕著な事実性向上は、同時に重要なトレードオフを伴うことも明らかになりました。95%目標の適用時において、元々生成された主張のうち、フィルタリングを通過して保持されたのはわずか4.41%〜31.09%に過ぎませんでした。また、全体として、フィルタリング後の応答のうち非空(何らかの回答が含まれる)であったのは9.70%〜51.40%にとどまりました。これは、厳格な事実性制御が、回答の網羅性や情報の豊富さを大きく犠牲にする可能性があることを示しています。
これらの結果は、適合性に基づく事実性制御がマルチホップRAGにも拡張可能であり、その事実性向上効果が高いことを明確に示しています。一方で、提案手法を実世界に適用する際には、単に名目上の信頼性スコアだけを見るのではなく、主張の保持率と拒否率も合わせて解釈することが不可欠であると、研究者らは結論付けています。事実性と情報の網羅性の間の最適なバランスを見つけることが、今後のマルチホップRAGシステム設計における重要な課題となるでしょう。
参考: arXiv cs.CL (アーカイブ) — 2026年10月1日 13:00 (JST)
原文ハイライト"Conformal Factuality Control for Multi-Hop Retrieval-Augmented Generation"