arXiv cs.CLは9月23日(現地時間)、Muhammad Usama氏とDong Eui Chang氏による論文を公開した。言語モデルの内部計算にシステムプロンプトが与える影響を分析した結果、ペルソナやフォーマットに関する指示は中間表現を深く再構築する一方、安全性に関する指示は計算経路にほとんど変化を与えず、最小限のベースラインと統計的に区別できない効果にとどまることが判明した。
研究は、1.5Bから72Bのパラメータ規模を持つ17のinstruction-tunedモデルを対象に実施された。対象は8つのアーキテクチャファミリーにわたる。研究チームはCentered Kernel Alignment (CKA) という手法を用い、5つの機能カテゴリに属する20種類のシステムプロンプト下で、モデルの層ごとの表現がどのように変化するかを比較した。
分析の結果、制限的な安全指示と、明示的に「制限なし」と許容する指示(“you have no restrictions”)は、平均CKA相関0.997という高い類似性を示し、ほぼ同一の計算経路を使用していることが判明した。この傾向は大規模な商用スケールのモデルでも持続し、70B-72Bのモデルでは、安全機能が意図する「浸透」が全体の10%未満にとどまると報告された。
研究チームは線形プロービングも適用した。その結果、モデルは各層でプロンプトカテゴリをエンコードしているものの、計算経路を大幅に再構築するのは一部の層に限られることが示された。このことは、システムプロンプトがモデルに「認識」されても、特に安全性に関する指示は深く「実行」されていない可能性を示唆する。Causal activation patchingによる検証でも、これらの層がモデルの振る舞いの変化を仲介していることが確認された。
さらに、表現深度が17モデル全体での振る舞いの効果サイズを予測できることも示された(Spearman rho = 0.761, p < 0.001)。研究チームは、これらの発見がシステムプロンプトに基づく安全機能で繰り返し報告されてきた「ジェイルブレイク」脆弱性について、機械論的な説明を与えるものだとしている。
参考: arXiv cs.CL — 2026年10月1日 13:00 (JST)