University of Central Florida(ユニバーシティ・オブ・セントラルフロリダ)の研究者らは2026年10月1日(現地時間)、大規模言語モデル(LLM)のフルパラメータファインチューニングにおけるメモリオーバーヘッドを大幅に削減する新しいオプティマイザ「TACO (Ternary Absolute-max Column-wise One-sparse Optimizer)」を発表した。この新手法は、既存のAdamW8bitと比較して、永続オプティマイザ状態を最大174分の1に、ピークトレーニングメモリを約2.9分の1に削減しつつ、同等の精度と実行時間を維持すると報告されている。

LLMのフルパラメータファインチューニングでは、オプティマイザの状態が大量のメモリを消費するため、最新のGPUで扱えるモデルサイズに制限がある。既存のアプローチは、オプティマイザ状態を圧縮するか、一次勾配を放棄するか、あるいは高密度な状態を維持しながら更新幾何学を変更する手法が用いられてきた。

先行するMuonオプティマイザは行列値更新によってメモリを削減するが、AdamWとは幾何学が異なるため、AdamWで事前学習されたモデルのファインチューニングにおいて性能劣化を引き起こす可能性があった。TACOは、このMuonの作用素ノルム最急降下法のアプローチをさらに発展させたものとなる。次元正規化された$1\to1$作用素ノルムのもとで、厳密な最急降下方向を計算し、2次元重み行列の各列で最も大きい絶対値のエントリの符号を選択する。これにより、一次勾配を保持しつつ、オプティマイザ状態メモリをほぼ無視できるレベルまで削減する。

実用的なTACOオプティマイザは、各列に対し少数の低精度勾配成分のみを維持する。OPT-13Bモデルでの実験結果によると、AdamW8bitと比較して永続オプティマイザ状態は27.7 GBから0.16 GBへと174分の1に削減された。また、ピークトレーニングメモリも80.6 GBから27.5 GBへと2.9分の1に削減された。これらの削減は、同等の精度と実行時間を達成しながら、1基の80 GB H100 GPUで300億から320億パラメータのモデルのフルパラメータファインチューニングを可能にする。


参考: arXiv cs.LG (アーカイブ) — 2026年10月2日 02:59 (JST)

この記事をシェア
X はてブ LinkedIn