Taha Entesari、Jingyu Zhang、Daniel Khashabi、Mahyar Fazlyabの4氏は2026年9月24日(現地時間)、機械学習に関する研究論文「Minimally Invasive Steering of Language Models」を学術誌arXiv cs.LGに投稿し、言語モデルの制御手法であるMinimally Invasive Steering Vector Optimization (MISVO)を提案した。この手法は、事前学習済み言語モデルをテスト時の報酬に適応させる際に発生する出力分布の劣化を抑制することを目的としている。

研究論文によると、既存のPre-logit steeringと呼ばれる手法では、凍結された言語モデルの最終隠れ状態にベクトルを加えることで報酬最適化を図る。しかし、無規制な報酬最適化は、出力分布を大きく変化させ、生成品質を低下させる可能性があることが指摘されている。

提案されたMISVOは、誘導されたトークン分布の局所KL幾何学(KL geometry)を用いて介入にペナルティを課す。これにより得られるフィッシャー二次形式(Fisher quadratic)は、分布の感度を測定し、凍結された言語モデルヘッドとの行列-ベクトル積を通じて解析的勾配の計算を可能にする。論文では、シーケンスレベルのKL勾配が解析的フィッシャー項とサフィックススコア関数項に分解されることを導出し、MISVOがモデルパラメータを更新することなく、位置固有の介入を最適化するために凍結参照サロゲートを利用すると説明されている。

約10億から140億パラメータを持つモデルを用いた選好(preference)およびコード生成(code-generation)タスクにおいて、MISVOは7つのモデル-タスク設定のうち6つで最高の平均報酬を達成した。多様性とコヒーレンス(coherence)スコアは、Best-of-Nに近い値を示したと報告されている。


参考: arXiv cs.LG (アーカイブ) — 2026年9月25日 02:46 (JST)

原文ハイライト

"Minimally Invasive Steering Vector Optimization (MISVO), which penalizes interventions using the local KL geometry"

この記事をシェア
X はてブ LinkedIn