arXivは2026年9月30日(現地時間)、Dongxu Cui氏らの研究チームによる、エージェント向けセキュリティモデル「ContractWarden」に関する論文を公開した。同モデルは、エージェントがファイルやネットワークへ直接アクセスする際に生じ得るプロンプトインジェクションや計画エラーによるオペレーティングシステムへの副作用を制限することを目的とする。エージェントやそのポリシー提案は信頼せず、人間が承認した損傷境界をLinuxカーネルレベルで強制する点が特徴である。

ContractWardenは、Linuxリファレンスモニターとして機能し、エージェントによるファイルおよびネットワークへのアクセスをカーネルレベルで管理する仕組みである。モデル側は「allow(許可)」「deny(拒否)」「no_egress(外部出力禁止)」の三段階からなるアセット契約を提案できるが、最終的な承認は人間が行う。信頼できないコードが実行される前に、実行ゲートがこの契約を具体的なタスクに紐付ける構成となっている。

データプレーンには、拡張Berkeley Packet Filter (eBPF) を用いたLinux Security Modules (LSM) が採用された。ファイルおよびネットワークに関する決定はこの仕組みを通じて強制され、「no_egress」の指定はプロセス、通常のファイル、パイプ、FIFO、およびサポート対象のUnixドメインソケットを通じて単調に伝播するよう設計されている。

研究チームは、合計19件のセキュリティテストで570回の実行を行い、ContractWardenが事前定義された戻り値および副作用の基準をすべて満たしたと報告した。3種類の同時実行ファイルI/Oワークロードを対象に計測したところ、Linux 6.15の仮想マシン上での平均オーバーヘッドは11.96%から12.89%、Linux 6.15の物理プラットフォーム上では35.79%から61.54%だった。これらの数値は、比較対象としたActPlaneベースラインを下回ったという。

研究チームは、宣言されたアセット、サポート対象のパス、および管理下にあるオブジェクトのライフサイクルに対し、決定論的なカーネル強制能力を示す結果だとしている。論文はarXiv(https://arxiv.org/abs/2609.38248)で公開されている。


参考: arXiv cs.CR — 2026年10月1日 13:00 (JST)

原文ハイライト

"enforces a human-authorized damage boundary without trusting the agent or its policy suggestions"

この記事をシェア
X はてブ LinkedIn