学術論文リポジトリarXiv cs.CRが2026年8月26日(現地時間)付けで、Retrieval-Augmented Generation (RAG) における攻撃と防御に関する調査論文「Retrieved But Not Reliable: A Survey on Attacks, and Defenses in Retrieval-Augmented Generation」を公開した。大規模言語モデル (large language models) の出力の事実性を高め、幻覚 (hallucinations) を低減するRAGは、コーパス汚染 (corpus poisoning) やプライバシー漏洩 (privacy leakage) など新たな堅牢性 (robustness) とセキュリティリスクを導入することが指摘されている。
本論文は、Minh Tran氏ら13名の著者によって執筆された。既存のRAGに関する調査が、攻撃者の目的、脅威モデル、およびRAGパイプライン全体の段階ごとの防御について限定的であった点を指摘し、RAGの堅牢性に関する統一的かつパイプラインを意識した概要を提示する。具体的には、コーパス (corpus)、リトリーバー (retriever)、ジェネレーター (generator) に対する脅威モデルを形式化し、攻撃を精度 (accuracy)、プライバシー (privacy)、公平性 (fairness) の3つの主要な目的に分類している。
防御策については、検索 (retrieval)、再ランク付け (rerank)、生成 (generation)、およびトレースバック (traceback) の各段階をカバーするパイプラインを意識した視点からレビューを実施。さらに、RAGの堅牢性をより深く評価・説明するための堅牢性ベンチマークと説明可能性 (explainability) 手法も要約している。
本論文は24ページ、6つの図から構成されており、Findings of the Association for Computational Linguistics: EMNLP 2026に採択され、ACL Rolling Review (ARR) を通じて査読済みであることが付記されている。
参考: arXiv cs.CR (アーカイブ) — 2026年8月27日 13:00 (JST)
原文ハイライト"Retrieval-Augmented Generation (RAG) enhances large language models by grounding outputs in external knowledge"