Dor Tirosh(ドール・ティロシュ)らは9月29日(現地時間)、学術論文公開サイトarXiv cs.CLにて、Latent Information Feedback Transformer(LIFT)と名付けられた新たなTransformerアーキテクチャと学習手法を発表した。これは、従来のTransformer言語モデルに内在するフィードフォワード型の情報伝達ボトルネックを事前学習段階で解消し、言語モデル(LMs)が生成ステップ間で状態を効率的に伝播できるようにする。実験結果では、LIFTが標準的なTransformerや他のベースラインを上回る性能を示し、次世代モデル開発の可能性を提示している。
従来のTransformer言語モデルはフィードフォワード型であり、深い層で生成された表現が浅い層に直接フィードバックされることはなかった。情報が下位層に伝達する唯一の経路は、デコードされたトークンに限られていたため、この狭いチャネルがモデルに中間結果の再計算を強制し、効率的な学習と推論を妨げる要因となっていた。
LIFTアーキテクチャは、この情報伝達のボトルネックを事前学習中に根本的に除去することを目指している。研究者らは、リカレントな状態学習を教師強制予測問題へと変換することでこの課題を解決した。具体的には、各入力トークンを、既存の事前学習済み言語モデルから得られた情報密度の高い次トークン分布の状態と組み合わせる。LIFTモデルは、少数の追加パラメータを用いて拡張され、次トークンとそれに続く状態の両方を予測するように学習される。入力状態は事前に計算されるため、事前学習プロセスは位置間で完全に並列で実行可能である。
推論段階では、モデル自身が予測した状態がフィードバックループを通じて再利用され、モデルサイズが大きくなるにつれて計算オーバーヘッドが相対的に減少する利点がある。1億3500万から10億パラメータの範囲で事前学習されたモデルを用いた実験では、LIFTは言語モデリング、下流の推論タスク、およびトークン一致予算下のプロシージャルタスクにおいて、標準的なTransformerや他のベースラインモデルを一貫して上回る性能を示した。さらに、計算量が同等なTransformerと比較しても、LIFTは同等かそれ以上の性能を達成している。
状態追跡タスクに関する厳密な制御下の研究においても、その優位性が確認された。小さなLIFTモデルは、タスクに失敗する従来のTransformerの状態データを用いて学習されたにもかかわらず、8倍多くのデータで学習された同サイズのTransformerを凌駕する結果を出した。これらの発見は、言語モデルがスケーラブルな教師監督を利用することで、事前学習中に深層から浅層へのフィードバック機構を効果的に活用できる可能性を示唆している。
参考: arXiv cs.CL (アーカイブ) — 2026年9月30日 02:57 (JST)