Xinran Zheng氏らは10月3日(現地時間)、大規模言語モデル (LLM) エージェント向けに、間接プロンプトインジェクション (IPI) 攻撃から保護するアクティブ防御手法「APEX」に関する研究論文をarXiv cs.CRで公開した。この手法は、攻撃パターンに依存しない防御を「実行境界」に集中させ、エージェントが内部状態を外部アクションや出力に変換する際に、不正な指令を阻止することを目的としている。

APEXは、間接プロンプトインジェクション (IPI) がLLMエージェントの実行時に読み込むコンテンツに敵対的な命令を隠蔽する問題に対処する。エージェントがTools、MCP servers、Skillsを含む異質な機能単位で構成されるため、インジェクションの伝播媒体が増加し、攻撃パターンを認識する従来の防御では追いつかないと指摘されている。

APEXは防御の焦点を、攻撃がどのように構築されるかではなく、タスクが何を許可するかに基づく安定した「実行境界」に移行する。実行境界とは、エージェントが内部状態を外部アクションや解放された出力に変換する地点を指す。ここでの安全性は、提案された効果が承認されているか、およびそれに到達する実行時情報が信頼されたタスクによって支持されているかの2つの条件にかかっている。

APEXは、信頼されない実行前にコンパイルされた単一の承認契約から、この境界で両条件を強制する。具体的には、evidence-gated prevention (エビデンスによるゲート型予防) により、契約が正当化する場合にのみ効果を認め、deception-based exposure (欺瞞に基づく露出) により、承認されていない使用を効果がコミットする前に露呈させる。これにより、保護はタスクが許可するものに従い、攻撃特有のポリシーや汚染追跡なしに、すべての機能単位に均一に適用されるという。

研究では、APEXは13のベースラインに対し、6つのベンチマークのうち5つで0%の攻撃成功率を達成し、残りの1つでは0.56%の攻撃成功率を記録した。さらに、3種類の機能単位すべてに対する適応型攻撃に対しても0%を維持し、ディフェンダーのバックボーン全体で効果を発揮した。


参考: arXiv cs.CR (アーカイブ) — 2026年10月7日 13:00 (JST)

原文ハイライト

"APEX: Active Protection at Execution Boundaries for LLM Agents"

この記事をシェア
X はてブ LinkedIn