arXivは9月22日(現地時間)、Model Context Protocol (MCP) を利用するエージェントがセマンティックなサプライチェーンリスクに直面しているとする研究論文を公開した。論文は、ツールのメタデータ最適化と実行トレース操作を組み合わせた二段階のブラックボックス型攻撃フレームワーク「A2M (Attraction-to-Manipulation)」を提示し、MCPエージェントを攻撃者の意図する結果へ誘導できることを示した。

論文によると、MCPエージェントはサードパーティサーバーからツールを選択する際、セマンティックマッチングに依拠する。この仕組みにより、攻撃者が制御するメタデータや出力を通じてエージェントが誤誘導されるセマンティックなサプライチェーンリスクが生じる可能性があるという。

A2Mは「Attraction」と「Manipulation」の二段階で構成される。Attractionフェーズでは、悪意のあるツールのメタデータを最適化し、エージェントによる当該ツールの呼び出し確率を高める。Manipulationフェーズでは、実行トレースを利用して敵対的ツールからの戻り値を調整し、エージェントを攻撃者が意図する結果へ誘導する。

評価にはベンチマーク「LiveMCPBench」を用いた。GLM-4.6モデルを対象とした直接攻撃では、四つのシナリオで平均93.6%の悪意あるツール呼び出し率を記録した。サービス拒否攻撃 (Cognitive Denial of Service) では、正当なベースラインと比較して加重トークンコストが32.4倍に増加したという。情報漏洩 (Information Exfiltration)、環境完全性侵害 (Environment Integrity Compromise)、推論逸脱 (Reasoning Derailment) の各シナリオでは、平均攻撃成功率が74.4%に達した。

A2Mフレームワークを再最適化せずに他の四モデルへ適用したところ、悪意あるツール呼び出し率は平均63.6%、トークンコストは2.7倍、攻撃成功率は平均24.5%となった。GLM-4.6での結果と比べ数値は低下するものの、モデルを横断して一定の攻撃効果を維持する傾向が確認されたとしている。

研究チームは、これらの結果がMCPエコシステムにおけるツール検証 (tool vetting) と実行時分離 (runtime isolation) の強化の必要性を示していると指摘している。論文に関連するコードは公開されており、原文はarXiv (arxiv.org/abs/2609.26761) で閲覧できる。


参考: arXiv cs.CR (アーカイブ) — 2026年9月23日 02:41 (JST)

原文ハイライト

"A2M (Attraction-to-Manipulation), a two-stage black-box framework for hijacking MCP agents."

この記事をシェア
X はてブ LinkedIn