Aniruddh Pramodらは10月6日(現地時間)、大規模言語モデル (LLM) エージェントの誤用監視に関する統一ベンチマークを提案した。この研究は、分解攻撃とプロンプトインジェクション攻撃という従来の評価で個別に扱われていた二種の脅威を共通のスキーマで評価することを目的としている。約6,200件の会話記録からなるベンチマークを構築したと、arXiv cs.CRで公開された論文で発表された。

LLMエージェントはマルチアクター環境での運用が増加しており、分解攻撃(有害なリクエストを無害なサブステップに分割する)やプロンプトインジェクション攻撃(侵害されたツールが悪意のある指示を配信する)など、複数のソースからの誤用リスクに直面している。

既存の評価手法はこれらの脅威を個別に扱い、ある軌跡が有害であるか否かを問うものの、いつ有害になるかについては問いかけていなかった。これに対し、Pramodらはエージェントの応答を監視することを提案している。監視が害を特定する最初の点が、エージェントの最初の有害なコミットメントから目標実行までの「害ウィンドウ」内に収まるかどうかを問いかける。

Pramodらは、トレースレベルの誤用監視に関する統一的な形式を開発し、これを用いてユーザー、LLMエージェント、および外部環境間の会話トランスクリプト約6,200件からなるベンチマークを構築したと述べている。このベンチマークは、両種の脅威を共通のスキーマで扱い、ラベル付けされた害ウィンドウ、対応する良性の対照、およびこれらの要求に対する拒否の事例を含んでいる。

17種類のモニター設定で評価した結果、提案されたアクションフレーム型モニターは、古典的な指標(AUC: それぞれ0.95と0.99)の下で両脅威に対して優れた性能を示した。一方、コンテンツフレーム型モニターはインジェクション攻撃に対して性能が大幅に低下(AUC: 0.52)することが判明した。また、古典的な位置盲目型指標はモニター性能を過度に楽観的に評価する可能性があり、全てのモニターが分解攻撃の局所化能力が低いことも示されている。


参考: arXiv cs.CR — 2026年10月7日 13:00 (JST)

原文ハイライト

"Towards a Unified Misuse Monitoring Benchmark"

この記事をシェア
X はてブ LinkedIn