リサーチ・論文 · 9月4日 23:20 強化学習の新手法TailRL、希少な高報酬に特化 Shrinivas Ramasubramanian氏ら研究チームは2026年9月3日(現地時間)、強化学習における平均報酬最適化の課題を解決する新たな手法「Tail-Likelihood Reinforcement Learning (TailRL)」に関する論文をarXivで発表した。この手法は、生成ポリシーにおける希少な高報酬の結果が得られる確率を直接最大化することを目指す。