LLM強化学習、単一層学習で全パラメータ同等効果か
arXiv cs.LGは7月1日(現地時間)、研究論文「Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training」を発表した。この論文は、大規模言語モデル(LLM)の強化学習(RL)後学習において、Transformerモデルの単一の層のみを学習させることで、モデル全体の全パラメータを学習するのと同等か、それを上回る性能向上が得られる可能性を指摘している。既存のRLアプローチの前提に疑問を呈し、層ごとの学習効果を分析した点が特徴だ。