FERPO、強化学習ポリシー最適化の信頼性向上へ新手法
arXiv cs.LGは10月1日(現地時間)、セバスチャン・サノコフスキー (Sebastian Sanokowski) 氏らが、オンライン強化学習のポリシー最適化アルゴリズム「Forward Entropy-Regularized Policy Optimization (FERPO)」を発表した。FERPOは、既存手法が抱えるクリティックのアクション勾配利用によるポリシー更新の信頼性低下問題に対し、クリティックをアクションに関して微分せずにポリシー改善を行うことで対処する。このオンポリシーの最大エントロピー強化学習アルゴリズムは、高精度な価値予測が必ずしも正確なアクション微分に繋がらないという課題を解決する。