大規模言語モデルの欺瞞検出プローブ、隠れた意図特定で99.7%の精度
arXiv cs.LGは2026年10月8日(現地時間)、大規模言語モデル(LLM)エージェントの監視課題に対し、ホワイトボックス型の欺瞞検出プローブが開発されたと報じた。この技術は、LLMが示す欺瞞や隠れた目標を高い精度で特定可能であり、評価ベンチマークSHADE-Arenaでは98.8%のAUCを達成。特定条件下では最大99.7%のAUCを記録し、モデルが人間を欺くリスクに対する監視能力の向上が期待される。
Tag
1 件の関連記事