Qishuai Jing氏らは2026年9月28日(現地時間)、学術論文投稿サイトarXiv cs.CRで、特権を持つLLMエージェントの実行を統制する新アーキテクチャに関する論文を発表した。提案は、LLMエージェントとオペレーティングシステムの間に「planner」「policy gate」「executor」「auditor」の4つの役割を設け、セキュリティと有用性の両立を狙う。直接実行下で98.3%だった攻撃成功率を、本アーキテクチャの導入により7.7%まで抑制したとしている。
この研究は、LLMエージェントがコマンド実行やファイル変更、API呼び出しといった実質的な特権を付与される現状を踏まえ、エージェントの誤動作がそのまま特権的な行動に直結してしまう課題を提起した。従来のエージェント活用では、入力さえ適切に制御すれば出力される行動も安全になるという前提が置かれがちだったとしている。
Jing氏らは、既存の防御策がエージェントへの入力制御に偏っている一方、候補となるアクションから特権的な副作用に至る経路についてはこれまで十分に検証されてこなかったと指摘している。この経路はモデル自体の挙動に依存せず、モデルの外部で統制されるべきだとの立場を示した。
提案されたアーキテクチャでは、アクションは構造化された意図として到着する設計となっており、シェル構文の解析を回避する。承認は、実行される正確なバイト列にひも付けられたワンショットクレデンシャルによって行われるとしている。これにより、承認後に別の処理へすり替えられるような介入の余地を狭めることを狙ったという。
評価は313件のケースを用いたベンチマークで実施された。8つのバリアントと、3つのホスト型LLMによるプロンプトオンリーのベースラインを150の階層化されたケースで5回ずつ試行し、合計2,250回の呼び出しのうち2,249回が完了した。
実験では、直接実行下での攻撃成功率が98.3%だったのに対し、本アーキテクチャ展開後は7.7%まで低下した。実システムへの再実行では、66のサンドボックス評価可能なペイロードにおいて7.6%という近い集計値を示した一方、ケースレベルでの不一致は大きかったとされ、従来11.1%あった誤拒否率は修正されたという。集計値の近さにもかかわらずケース単位でのばらつきが大きいことは、平均的な成功率だけでは実運用上のリスクを把握しきれない可能性があることを示していると見られる。
オペレーティングシステムのサンドボックス導入により、攻撃成功率は最終段階で30.8%から7.7%へとさらに減少した。ベンチマークの過程では4件の実装上の欠陥も発見され、これらは設計レビューの段階では見過ごされていたとされている。
参考: arXiv cs.CR — 2026年10月1日 13:00 (JST)
原文ハイライト"Separation of Duties for Privileged LLM Agents: A Governed Execution Architecture"