arXiv cs.CLは9月30日(現地時間)、大規模言語モデル(LLM)の「拒否」行動がTransformer内部でどのように表現・操作されるかに関する論文を発表しました。Vincent Siu氏、Glenn Grant-Richards氏、Vlad Pavlovich氏、Yizhou Sun氏、Dawn Song氏、Chenguang Wang氏ら研究者グループによるこの研究は、活性化ステアリングのメカニズムを解明し、拒否行動が拡散的にエンコードされるのではなく、特定の構造化されたメカニズムによって組み立てられていることを指摘しています。

研究グループは、拒否ステアリングをコンポーネントレベルで分解し、4つのオープンウェイトモデルで介入を実施しました。その結果、アテンションおよびMLP(Multi-Layer Perceptron)コンポーネントのスパースなサブセットを特定し、これらのステアリングのみで完全な行動効果を再現できることを発見しました。

詳細な分析により、拒否方向は上流コンポーネントの28〜48%を構成するスパースなコンポーネントメカニズムに集中し、ステアリング効果の88〜101%を維持することが判明しました。さらに、これらのメカニズム内では、有効なステアリングが残差ストリームの約50%の次元に集中し、コンポーネントメカニズムベースラインの85〜98%を維持することが示されました。このことから、スパース性はどのコンポーネントがステアリングされるかとそれらのコンポーネント内のどの次元が信号を運ぶかという2つのレベルで機能することが示唆されています。

これらの発見は、Transformer全体に拒否行動が漠然とエンコードされているのではなく、構造化され特定可能なメカニズムによって構築されていることを示しています。これにより、拒否行動がどのように表現され、ステアリングされるかについてのメカニズム的理解の基礎が提供されます。論文はCOLM 2026に採択されており、研究の再現性を促進するため、全てのコードと生実験結果は公開されています。


参考: arXiv cs.CL (アーカイブ) — 2026年10月7日 13:00 (JST)

原文ハイライト

"Component and Dimension Sparsity in Transformer Refusal Mechanisms"

この記事をシェア
X はてブ LinkedIn