リサーチ・論文 · 9月27日 00:19 強化学習予測フレームワーク「PoEM」発表、既存ポリシーから結果近似 arXivは2026年9月24日(現地時間)、強化学習 (RL) モデルの後学習における計算コストと不安定性という課題に対処する新たなフレームワーク「PoEM」を発表した。このフレームワークは、新しい報酬関数が与えられた際に、実際にRLを実行することなくその結果を予測することを可能にする。PoEMは、既存の報酬で既に後学習されたモデル群を利用し、追加のRL学習なしで目標とするRLポリシーを近似する。