arXiv cs.CRは2026年10月7日(現地時間)付けで、言語モデルエージェント(LLM Agents)の認証情報漏洩と回復能力を評価する新しいベンチマーク「CredLeak-Bench」に関する論文を発表した。同論文は、Rafid Ahmed氏らが執筆したもので、エージェントがフィッシング攻撃や本人確認に直面した際の自動化能力とセキュリティを総合的に評価することを目的としている。初期評価では、テストされたすべてのモデルが情報漏洩に対して脆弱であることが示された。
同論文によると、LLMエージェントは電子メール管理やソーシャルメディア、銀行業務など日常のデジタル作業を自動化するために導入が進んでいる。しかし、この機能は同時に、機密情報をフィッシングのリスクに晒す可能性を指摘している。安全な実行には、単に動作を拒否するのではなく、悪意のあるリクエストを正規のリクエストと区別する能力が求められる。
CredLeak-Benchは、エージェントがフィッシングや本人確認に直面した際の効率性とセキュリティを評価するために設計された包括的なベンチマークである。このベンチマークは、ユーザーが直接認証を指示するシナリオと、エージェントが明示的にログインを指示されていない自律的な受信トレイ監視の両方を網羅している。欺瞞的な手がかりを体系的に変化させ、フィッシングシナリオを正規の対応シナリオと組み合わせることで、情報漏洩と正規タスクにおける有用性の両方を評価する。
サンドボックス環境内では、情報漏洩はエージェントの自己申告による行動ではなく、実際の情報提出を通じて測定される。評価結果として、テストされたすべてのモデルが情報漏洩に対して脆弱であることが判明した。また、エージェントは自律的な受信トレイ監視中にも機密情報を開示する可能性があり、ユーザーが認証を要求していない状況でもフィッシングが情報開示を誘発しうることが示された。
さらに、情報漏洩を低減するための既存の対策の多くは、正規タスクのパフォーマンスを低下させる傾向があり、既存の防御策にはセキュリティとユーティリティのトレードオフが存在することが明らかになった。CredLeak-Benchは、不正な情報開示の防止と正規タスクの完了という両方の目標を測定し、安全で有用なエージェント開発に向けた進捗を評価するための統制されたフレームワークを提供する。
参考: arXiv cs.CR (アーカイブ) — 2026年10月8日 13:00 (JST)
原文ハイライト"Our evaluation reveals that all tested models are vulnerable to leakage."