arXiv cs.LGは2026年10月1日(現地時間)、言語モデルがコンポーネントのアブレーション後に自己修復する現象に関する新たなメカニズムを提唱する研究論文を発表した。この論文は、アブレーション前から存在するゲインが要因となり、他のコンポーネントが「カウンターウェイト」として機能することで、一見して自己修復に見える調整・補償が行われると説明している。
研究論文Every Ablation Is a Dose: Counterweights and the Semblance of Self-Repairは、言語モデルの自己修復現象について、そのメカニズムがこれまで不明であった点を指摘している。これまでの研究では単一の説明は見出しにくいとされていた。論文では、因果的に重要なコンポーネントへの介入が座標軸 $\lambda$ 上の点として扱われ、その結果生じるきめ細かなユニット $r$ の因果的修復応答は、アフィン法則 $E_r(\lambda)=\mathrm{own}_r+\gamma_r\lambda$ に従うことを示した。
この法則において、傾き $\gamma_r$ はモデルに常に影響を与える固定係数であり、その符号が除去された信号に対してユニットが対抗するか、あるいは強化するかを決定する。論文著者らは、Gemma、Qwen、LLaMA、Mistralの4つの異なるモデルファミリーにおいて、MLPニューロン、OVニューロン、特異方向を含むコンポーネントがこのアフィン法則に従うことを確認した。具体的には、81の下流方向のうち68がこの法則に合致した。また、$,\gamma_r$ の大きさは固定された重みから予測可能であると述べている。
GPT-2 SmallのIOI回路における検証では、介入が到達可能な10のヘッドのうち7がこの法則に従い、そのすべてがカウンターウェイトとして機能していた。この研究の視点では、自己修復と見なされていた現象は、実際にはコアで対照信号が出現した際に、カウンターウェイトが通常の操作を実行しているものとして解釈される。
参考: arXiv cs.LG (アーカイブ) — 2026年10月2日 02:57 (JST)
原文ハイライト"what may appear as self-repair is a counterweight performing its usual operation"