LLMプライバシー監査の新手法「WPMIA」がブラックボックスモデルで高精度達成
arXiv cs.CRは2026年9月8日(現地時間)、大規模言語モデル (LLMs) のプライバシーリスクを監査するための新たなメンバーシップ推論攻撃 (MIAs) 手法「Word-level Probability MIA (WPMIA)」に関する論文を公開しました。この手法は、既存のMIAsがトークンごとの確率へのアクセスを必要とするのに対し、厳密なブラックボックスモデルにも適用可能で、GPT-5-Chatなどの主要なプロプライエタリLLMsで平均42.0のTPR@5%FPRを達成しています。