Chung Min Kim氏らは2026年10月6日(現地時間)、オンラインオフポリシー強化学習アルゴリズム「QF3 (Fast Flow RL with Filtered Q-Gradients)」を発表した。フローポリシーの学習を目的としたこの手法は、批評家のアクション勾配をフィルタリングして適用することで、安定性と効率性を高める。これにより、ヒューマノイドのロコモーションポリシーをゼロから学習させ、実機へのゼロショット転送を可能にした。また、既存のオンポリシー手法と比較して学習速度を大幅に向上させる。
QF3は、フローマッチングと批評家のアクション勾配を組み合わせてフローポリシーを訓練する。この勾配は、フローの出力の1ステップ予測を介して逆伝播される。更新の信頼性を維持するため、QF3は、批評家と予測が信頼できるアクション次元にのみ批評家勾配を適用する。具体的には、リプレイアクションに近いアクション次元に限定される。
このアルゴリズムは、オフポリシーフロー強化学習 (RL) メソッドとして、ヒューマノイドのロコモーションポリシーをゼロから学習させ、それをハードウェアへゼロショットで転送できる初の事例とされている。高スループットのオフポリシー訓練レシピと組み合わせることで、QF3はヒューマノイドのロコモーションおよびモーショントラッキングポリシーを、既存のオンポリシーフローRLメソッドであるFPO++と比較して、壁時計時間で10倍高速に訓練することが可能である。
さらにQF3は、ABC-SimおよびRobomimicタスクにおいて、事前学習済みのフローベース操作ポリシーのファインチューニングにも応用された。これらの結果は、QF3がロボットポリシーをゼロから学習させる能力と、デモンストレーションから取得したポリシーを洗練させる能力の両方を持つことを示唆している。
参考: arXiv cs.RO — 2026年10月7日 02:59 (JST)
原文ハイライト"QF3 is the first off-policy flow RL method to train humanoid locomotion policies from scratch"