QF3がオフポリシー強化学習アルゴリズムを開発、ロボット学習を高速化
Chung Min Kim氏らは2026年10月6日(現地時間)、オンラインオフポリシー強化学習アルゴリズム「QF3 (Fast Flow RL with Filtered Q-Gradients)」を発表した。フローポリシーの学習を目的としたこの手法は、批評家のアクション勾配をフィルタリングして適用することで、安定性と効率性を高める。これにより、ヒューマノイドのロコモーションポリシーをゼロから学習させ、実機へのゼロショット転送を可能にした。また、既存のオンポリシー手法と比較して学習速度を大幅に向上させる。