Sarim Hashmi、Mukul Ranjan、Kshitij Mishra、Mikhail Kuznetsov、Praneeth Vepakomma、Nils Lukasの各氏は10月6日(現地時間)、ウェブエージェントに対する適応型プロンプトインジェクションへの防御手法「AdvSim2Real」を発表した。この研究は学術論文アーカイブarXiv cs.CLを通じて公開されたもので、サードパーティのウェブページからの不正な指示により、ウェブエージェントがユーザーの意図した目標から逸脱するリスクと、既存の防御策が適応する攻撃者によって容易に回避される課題への対策を目指す。
この研究チームが提案する防御手法「AdvSim2Real」は、凍結されたウェブワールドモデルの環境下で、タスクカリキュラム、インジェクションアドバーサリー、エージェントを同時に進化させる共進化アプローチを採用している。この共進化プロセスにおいて、カリキュラムは、エージェントがタスクの約半分を成功裏に解決できる場合に報酬を与えるよう設計されている。
一方で、インジェクションアドバーサリー(攻撃者)は、エージェントが成功と判断したタスクを失敗に転換させる「成功反転」攻撃が成立した場合にのみ報酬を受け取る。この報酬システムにより、エージェントは攻撃への耐性を高め、アドバーサリーはより巧妙な攻撃手法を開発するインセンティブを持つことになる。
シミュレーターを用いた訓練を通じて、4Bエージェントは能力と堅牢性の両面で顕著な向上を示した。具体的には、攻撃の有無にかかわらずタスク完了率が上昇し、訓練を受けていないフロンティアモデルアドバーサリーに対しても高い耐性を発揮した。研究チームは、この能力向上が実際のブラウザ環境でも確認されたと報告している。
「AdvSim2Real」の有効性は、150種類の多岐にわたるウェブタスクを用いた詳細な評価によって検証された。その結果、AdvSim2Realを適用したエージェントは、訓練されていないアドバーサリーに対するタスク完了率を、ベースエージェントと比較して33.6%向上させることに成功した。これは、ウェブエージェントが直面するプロンプトインジェクション攻撃への実用的な防御策としてのAdvSim2Realの可能性を示唆している。
参考: arXiv cs.CL (アーカイブ) — 2026年10月7日 02:56 (JST)
原文ハイライト"Training Web Agents Against Adaptive Prompt Injection"