LLMユーザー信念抽出に新手法、自己蒸留で行動操作
arXiv cs.LGは2026年9月25日(現地時間)、大規模言語モデル (LLM) がユーザーの暗黙的な属性を推論し、その振る舞いを操作する新たなフレームワーク「Belief Self-Distillation (BSD)」に関する論文を公開した。この手法は、凍結されたLLM自身を教師として活用し、外部からの注釈なしに自然な会話からユーザーの信念を抽出する。従来のプロービング手法が活性化情報に焦点を当てるのに対し、BSDは因果的役割を直接検証可能な状態を分離する点で特徴的だ。