arXiv cs.CR が2026年8月11日(現地時間)付けで報じたところによると、Spiros Tsigkopoulos氏とChristoforos Ntantogian氏が、大規模言語モデル (LLM) をウェブアプリケーションに統合する際に生じる古典的な脆弱性を再検討する研究論文を発表した。ユーザー入力が生成テキストのみならず、データベースクエリやHTTPリクエストなどのバックエンド操作にも影響を与える可能性を指摘している。
本論文では、LLM媒介型ウェブ攻撃 (LLM-mediated web attacks) と呼ばれる攻撃クラスを導入している。これは、攻撃者によって制御された入力がLLM統合アプリケーションによって変換され、従来のウェブアプリケーションのシンクに到達する攻撃である。この攻撃対象領域を、LLM2SQLi、LLM2XSS、LLM2SSTI、LLM2CommandInjection、LLM2IDOR、LLM2CSRF、LLM2XXE、LLM2SSRFといった代表的なLLM2Xの派生形を通じて体系化している。
分析の結果、LLMが根本的な脆弱性自体を作り出すことは通常なく、むしろ仲介レイヤーとして機能し、一部のツール有効化設定においては混乱した代理人 (confused deputy) として、モデル生成またはモデル影響下のコンテンツを信頼するコンポーネントに攻撃者の影響を伝達することが示されている。実験的なケーススタディとして、FlaskベースのLLM統合型ウェブアプリケーションであるTicketOracleを実装し、5つの攻撃シナリオと7つのLLMにわたるLLM2SSRFの評価が行われた。
その結果、モデル間で感受性に実質的なばらつきがあることが判明し、悪用は安全でないアプリケーションアーキテクチャとモデル固有の動作の両方に依存することが示唆された。論文は、プロンプト、モデル、アプリケーション、およびネットワーク層にわたる軽減戦略について結論を述べている。
参考: arXiv cs.CR (アーカイブ) — 2026年8月12日 13:00 (JST)
原文ハイライト"We conclude with mitigation strategies across the prompt, model, application, and network layers."