arXiv cs.LGは10月1日(現地時間)、セバスチャン・サノコフスキー (Sebastian Sanokowski) 氏らが、オンライン強化学習のポリシー最適化アルゴリズム「Forward Entropy-Regularized Policy Optimization (FERPO)」を発表した。FERPOは、既存手法が抱えるクリティックのアクション勾配利用によるポリシー更新の信頼性低下問題に対し、クリティックをアクションに関して微分せずにポリシー改善を行うことで対処する。このオンポリシーの最大エントロピー強化学習アルゴリズムは、高精度な価値予測が必ずしも正確なアクション微分に繋がらないという課題を解決する。
FERPOは、エントロピーとKullback-Leibler (KL) divergenceで正則化されたポリシー改善目的から、最適なターゲットアクション分布を導出する新たなアプローチを採用している。その後、アクターはロールアウトポリシーから得られたアクションを利用したself-normalized importance sampling (SNIS) によって推定される前方KL目的を最小化することで、この導出されたターゲットに適合するように学習を進める。このKL正則化の導入は、ターゲット分布がロールアウトポリシーから過度に逸脱することを制限し、結果としてインポータンスウェイトの安定性を維持する効果を発揮する。
既存の多くのアプローチで用いられるリバースKL目的が、ターゲット分布の特定のサブセットモードを優先する傾向があるのに対し、FERPOが採用する前方KL目的は、複数の高価値モードを広範囲にカバーすることを促進し、より効率的で広範な探索を促す。この特性は、複雑な環境における強化学習の性能向上に寄与すると考えられる。
MuJoCo Playgroundおよび「ManiSkill」といった代表的なベンチマーク環境における実験と、綿密なアブレーション(構成要素解析)の結果は、FERPOが既存の競争力のある手法と比較して、優れた性能とサンプル効率の向上を示している。さらに、計算ベンチマークにおいても、同種のアルゴリズムであるRelative Entropy Pathwise Policy Optimization (REPPO) よりも高速なアクター更新が実証されており、実用面での優位性も示唆されている。
参考: arXiv cs.LG — 2026年10月2日 02:59 (JST)