言語モデル強化学習に新手法「ExpDis」、探索と最適化を分離
arXiv cs.LGが2026年10月7日(現地時間)付けで報じたところによると、Saif Punjwani氏とMicah Goldblum氏は、検証可能な報酬による強化学習(RLVR)における新たな手法として「Exploration-Distillation (ExpDis)」フレームワークを提案する論文を公開した。現代の言語モデルでは、事前に訓練されたチェックポイントにRLVRを適用するが、従来の強力な新規性インセンティブの導入はモデル品質を低下させる課題があった。ExpDisは、探索と最適化のプロセスを分離することで、この問題を解決するとしている。