arXiv cs.CVは10月3日(現地時間)、論文「Beyond the Linear Representation Hypothesis: Non-Linear Activation Steering in Text-to-Image Models」を公開し、テキスト-画像モデルにおける高レベル概念の非線形表現を制御する新手法「KANSteer」を提案した。本研究は、従来のメカニスティック・インタープリタビリティで広く用いられてきた線形表現仮説(LRH)に疑問を投げかけ、概念の推移を曲線としてモデル化するKolmogorov-Arnold Networks(KANs)の活用を提示する。

Muhammad Atif Butt氏、Paweł Skierś氏、Joost Van De Weijer氏、Kamil Deja氏らが率いる研究チームは、メカニスティック・インタープリタビリティにおいて、高レベルの概念が活性化空間の線形方向として符号化されると仮定する線形表現仮説(LRH)に疑問を呈した。

研究者らは、自然な視覚的概念の遷移が必ずしも線形であるとは限らない点を指摘している。具体的には、「晴れ」と「嵐」の間には、「いくつかの白い雲がある空」のような中間的な気象状態が存在し、これは単に「弱い嵐」とは区別される。同様に、「毛虫」が継続的に羽根の生えた毛虫として表現されるわけではないように、「毛虫」から「蝶」への進行も線形ではない。これらの真の中間状態がモデルによって非線形に表現されているかという問いに基づき、テキスト-画像モデルが中間属性のプロンプトを受けた際、その活性化が端点をつなぐ直線に沿うことは稀であると報告された。

この観測結果から、研究チームは概念の推移を中間状態を通る曲線としてモデル化する手法「KANSteer」を提案した。KANSteerは、シンプルかつ解釈可能な表現を実現するため、Kolmogorov-Arnold Networks(KANs)を活用する。KANsは1次元座標を提供し、学習された関数によって概念の軌跡を定義することを可能にする。これにより、操縦方向を概念の経路に沿って変化させながら、解釈可能性を維持できるという。

複数の概念とテキスト-画像拡散トランスフォーマーを用いた実験が行われた結果、活性化軌跡が直線から大きく逸脱していることが確認された。さらに、KANSteerが線形操縦と比較して、より高い適合度と中間属性のスムーズな推移を提供することが実証された。


参考: arXiv cs.CV — 2026年10月7日 13:00 (JST)

原文ハイライト

"Beyond the Linear Representation Hypothesis: Non-Linear Activation Steering in Text-to-Image Models"

この記事をシェア
X はてブ LinkedIn