arXiv cs.CRは10月6日(現地時間)、「PyCache Trap: The Inspection-Execution Gap in Agent Skill Scanners」と題した研究を発表した。この研究は、エージェントスキルにおける検査と実行の乖離に焦点を当てている。特に、サードパーティパッケージにエージェントのランタイムアクセスを許可する既存のスキル評価では、ドキュメントや可視ソースコードが検査される一方で、Pythonが異なる振る舞いを持つバイトコードキャッシュを実行する可能性を指摘。PyCache Trapは、この乖離を悪用することで、検証済みスキルに対して94-100%の高い攻撃成功率を達成した。
エージェントスキルは、命令と実行可能リソースを組み合わせてサードパーティパッケージにエージェントのランタイムアクセスを許可する。しかし、現在のスキルスキャナーは主にドキュメントや公開されているソースコードを検査するにとどまっている。これに対して、研究チームは、Pythonがバンドルされたバイトコードキャッシュを実行する可能性があり、そのキャッシュがソースコードとは異なる振る舞いを示す場合があることを指摘している。
「PyCache Trap」と名付けられたこの研究は、無害なソースコードと置き換えられたバイトコードキャッシュを組み合わせ、これをローダーに受け入れさせ、タスク関連の呼び出しに接続する手法を詳細に分析した。この手法を100のスキルと7つのスキャナーで評価した結果、PyCache Trapは94-100%の攻撃成功率を達成したことが示された。この攻撃において、既存のスキャナーはキャッシュ内に隠蔽された振る舞いを意味的に認識できなかった。
この課題に対し、研究チームは実行を考慮した検証(EAV: execution-aware validation)の導入を提案している。EAVは、検査された命令、スクリプト、インポート、およびランタイムアーティファクトを型付き実行グラフに接続することで、検査と実行の間のギャップを埋めることを目指す。EAVは、基礎となる振る舞い分析とコンパイル済みアーティファクトの信頼できる再現を組み合わせることで機能する。評価の結果、EAVはテストされた100のソースコードありキャッシュ置換ケースをすべて検出し、5つの攻撃ファミリーと200の無害なスキルにおいて、偽陽性率(FPR)10.0%で92.8%のリコール率を達成した。
これらの結果は、エージェントスキルの承認プロセスにおいて、ランタイムが選択できる実行可能アーティファクトを、サポートされるローダーとコードオブジェクトの正規化の範囲内でチェックすることの重要性を示唆している。
参考: arXiv cs.CR (アーカイブ) — 2026年10月9日 13:00 (JST)
原文ハイライト"The Inspection-Execution Gap in Agent Skill Scanners"