AIレッドチーム評価の限界と証拠的価値を形式化
arxiv.orgは2026年7月23日(現地時間)、「What AI Red-Team Evaluations Can and Cannot Prove」と題する論文を発表した。同論文は、AIモデルのレッドチーム評価が証明できる範囲とできない範囲を厳密に定義し、評価の「証拠的上限 (evidential ceiling)」を計算可能な形式で導出した。バンダナ・カウル (Bandana Kaur) 氏が執筆した本稿は、特定のハーム率を下回る稀なリスクカテゴリーにおいて、現行のパッシブベンチマークが十分な安全性の証拠を提供できない可能性を指摘している。