arXivは2026年9月24日(現地時間)、強化学習 (RL) モデルの後学習における計算コストと不安定性という課題に対処する新たなフレームワーク「PoEM」を発表した。このフレームワークは、新しい報酬関数が与えられた際に、実際にRLを実行することなくその結果を予測することを可能にする。PoEMは、既存の報酬で既に後学習されたモデル群を利用し、追加のRL学習なしで目標とするRLポリシーを近似する。

ファウンデーションモデルの強化学習 (RL) 後学習プロセスは、莫大な計算コストを要求し、その結果はしばしば不安定な特性を示す。特に、報酬モデルの変更や複数の報酬を組み合わせる必要がある場合、学習を常に最初から再実行しなければならず、効率性の低下を招いていた。このような背景に対し、Kimia Hamidieh氏、Giannis Daras氏、Antonio Torralba氏らの研究チームは、この非効率性を解決するための新しいアプローチとしてPoEMを提案した。

PoEMはPredicting RL Outcomes from Existing Policiesの略であり、新しい報酬関数が与えられた際に、実際のRL実行を伴わずにその成果を予測する能力を持つ。このフレームワークの根幹をなすのは、既存の報酬によって既に後学習が完了している一連のモデル群を効果的に活用する点にある。研究チームはまず、理論的な基盤として、新しい報酬関数が既存の報酬の線形結合として表現できる場合、対数空間における新しいポリシーも既存の対数ポリシーの線形結合として記述可能であることを数学的に示した。これは、特定の条件下でポリシー間の関係性を線形モデルで捉えられることを意味する。

さらに、報酬が必ずしも線形に連結できない、より複雑なシナリオにおいても、RL学習によって生成される対数ポリシーが報酬空間全体で近似的に低ランクの部分空間を形成するという重要な観察結果を得た。この発見は、異なる報酬関数に対応するポリシーが、より本質的な低次元構造を共有している可能性を示唆している。この共通の低ランク部分空間における結合係数(重み)は、与えられた報酬情報、または既存のベースポリシーの出力サンプルのみを用いて効率的に推定できることが示された。これにより、広範なシナリオにおいてPoEMが適用可能であることが裏付けられた。

これらの理論的・実証的観察に基づき、研究チームは具体的なアルゴリズムを構築した。このアルゴリズムは、後学習済みのモデルコレクションと新しい報酬関数を入力として受け取る。そして、追加のRL学習を実際に行うことなく、目標とする新しいRLポリシーを近似する出力を行う。このアプローチの有効性は、テキストおよび画像モダリティにわたる合成データセットおよび実世界からの報酬データを用いた広範な実験を通じて検証された。実験結果は、PoEMが既存の強化学習プロセスの効率性と柔軟性を大幅に向上させる可能性を秘めていることを示している。


参考: arXiv cs.LG — 2026年9月25日 02:50 (JST)

原文ハイライト

"PoEM: Predicting RL Outcomes from Existing Policies"

この記事をシェア
X はてブ LinkedIn