arXivは9月29日(現地時間)、論文「DIBench: Benchmarking Decision Integrity of GUI-based Mobile Agents Under Deceptive Injections」を発表し、GUIベースのモバイルエージェントにおける新たな安全性評価ベンチマーク「DIBench」を提案した。既存手法が見過ごしてきた「in-task goal deviation risk」の測定を目指す。

DIBenchは、7つの商用アプリと3つのシミュレートされたアプリ、5種類のタスクタイプを対象とする。非特権UIコンテンツに限定された脅威モデルのもと、重要な選択を誘導する8種類の欺瞞的な注入プローブインスタンスを構築した。ベンチマークは1,000のクリーンインスタンスと36,672の注入インスタンスで構成され、統一されたプロトコルと完全性メトリクスを提供する。

著者らは、4つのエージェントフレームワークと7つのベースモデルを用いた実験で、完了ベースの評価がエージェントの信頼性を過大評価し、意思決定の完全性リスクを見過ごす可能性を示した。欺瞞的な注入は選択を誘導し、初期行動ポリシーを変化させることで、完了率を不当に高め、安全性の誤解を生む。一般的な防御策(検出、画像前処理、プロンプトリマインダーなど)は、完全性向上において一貫性のない結果を示した。

本研究は、モバイルエージェントにおけるin-task goal deviation riskを定量化し、安全防御策の比較評価を可能にする統一された再現可能なベンチマークをDIBenchが提供すると結論付けている。本研究はNeurIPS 2026のEvaluations and Datasetsトラックに採択された。


参考: arXiv cs.CR (アーカイブ) — 2026年10月7日 13:00 (JST)

原文ハイライト

"DIBench: Benchmarking Decision Integrity of GUI-based Mobile Agents Under Deceptive Injections"

この記事をシェア
X はてブ LinkedIn