arXiv cs.LGは2026年9月25日(現地時間)、大規模言語モデル (LLM) がユーザーの暗黙的な属性を推論し、その振る舞いを操作する新たなフレームワーク「Belief Self-Distillation (BSD)」に関する論文を公開した。この手法は、凍結されたLLM自身を教師として活用し、外部からの注釈なしに自然な会話からユーザーの信念を抽出する。従来のプロービング手法が活性化情報に焦点を当てるのに対し、BSDは因果的役割を直接検証可能な状態を分離する点で特徴的だ。
Belief Self-Distillation (BSD)は、LLMの内部でユーザーの信念を読み書き可能にする統合フレームワークとして提案されている。この技術は、線形プロービングと因果的プロービングの両方を橋渡しするアプローチを取り、デコード可能かつモデルへの書き込みが可能なコンパクトなユーザー表現の学習を可能にする。具体的には、外部からのデータ注釈を必要とせず、LLMが自身を教師として用いることで、ユーザーとの自然な会話からその信念を効果的に抽出できる。
研究チームは、複数のモデルファミリーにわたる検証を通じて、BSDがユーザーの信念を高い精度で回復できることを確認した。この手法は、LLMの隠れ状態を直接操作する既存の「隠れ状態ステアリング」と比較して、はるかに強力な介入能力を持つことが示された。特に注目すべきは、モデルの応答拒否が、単なるユーザーのリクエスト内容だけでなく、LLMが推論したユーザーの意図にも依存することが明らかになった点だ。BSDを用いてユーザーの信念を変更することで、元のリクエストが全く同じであるにもかかわらず、LLMの拒否反応が変化する事例が確認されており、これはLLMの振る舞いを制御する新たな可能性を示唆している。
さらに、独立して訓練された異なるLLMが、ユーザー表現のための共通の幾何学空間に収束するという顕著なクロスモデル規則性も発見された。これらの発見は、LLMの内部に構築される暗黙的なユーザーモデルが、単なる抽象的な概念ではなく、読み書き可能かつ因果的に操作可能な具体的な内部状態として存在することを示している。このことは、LLMがユーザーとのインタラクションにおいて安全性に関する意思決定を行うメカニズムに直接的な影響を及ぼし、より信頼性の高いAIシステムの開発に繋がる可能性がある。
参考: arXiv cs.LG (アーカイブ) — 2026年9月26日 02:54 (JST)