Transformer拒否メカニズムの希薄構造を解明
arXiv cs.CLは9月30日(現地時間)、大規模言語モデル(LLM)の「拒否」行動がTransformer内部でどのように表現・操作されるかに関する論文を発表しました。Vincent Siu氏、Glenn Grant-Richards氏、Vlad Pavlovich氏、Yizhou Sun氏、Dawn Song氏、Chenguang Wang氏ら研究者グループによるこの研究は、活性化ステアリングのメカニズムを解明し、拒否行動が拡散的にエンコードされるのではなく、特定の構造化されたメカニズムによって組み立てられていることを指摘しています。