論文「Capacity, Responsiveness and Alignment: What Makes a Latent Structure Actionable」は9月27日(現地時間)、言語モデル(LMs)の活性化空間における潜在構造が因果的影響を及ぼす際の3つの主要因として、「Capacity」「Responsiveness」「Alignment」を提示した。本研究は、モデルの振る舞いを理解し、制御するための新しいアプローチを示唆している。
Or Shafran氏とMor Geva氏らが共同執筆した本論文は、言語モデルの出力に対する構造に沿った動きの感度を測るCapacity、現在の文脈で概念がどれだけ促進可能かを示すResponsiveness、そして構造が文脈固有の概念表現とどれだけ整合しているかを示すAlignmentを、因果的影響を決定する要因として定義した。
研究チームは、4つのLMファミリーと50の概念にわたる実験を通じて、因果的効果にはこれらすべての要因が高い水準にあることが必要であると指摘した。特に、Capacityが低い場合とResponsivenessが低い場合、因果的効果はそれぞれ84%および95%削減されることが観測された。一方、Alignmentが低い場合は因果的効果が逆転し、概念表現を抑制する可能性も指摘されている。
さらに、因果性は構造の固有の特性ではなく文脈依存的であるとし、因果的に効果的な方向が文脈によって変化する低次元の部分空間を形成すると報告された。研究チームは、この部分空間に線形プローブのトレーニングを制限することで「causal probes」を導入した。これにより、概念検出能力を3%の削減に抑えつつ、モデル間での制御において17%から118%の改善を達成したと結論付けている。
参考: arXiv cs.CL — 2026年10月7日 13:00 (JST)
原文ハイライト"Capacity, Responsiveness and Alignment: What Makes a Latent Structure Actionable"