arXiv cs.CVは2026年9月30日(現地時間)、論文「ExploreNet: Learning Where to Explore in Diffusion GRPO」を発表した。この論文は、グループ相対強化学習(GRPO)手法を用いた画像生成モデルの探索において、適応的な探索分布を学習する「ExploreNet」の導入を報告している。Stable Diffusion 3.5 Mediumを用いた評価では、既存手法Flow-GRPOと比較してGenEval2で14%の性能向上を達成し、人間による選好評価で67.2%の勝率を記録した。

この研究は、Flow-GRPOのようなグループ相対強化学習手法が、デノイジングの各ステップで等方性ガウスノイズを加えて探索を行う点に着目している。従来の探索ノイズが潜在表現の全てのチャネルおよび空間位置に均等に適用されるのに対し、本研究では、潜在要素が生成画像に与える影響が異なることを示し、これらの違いに適応した探索が必要であると提唱した。

導入されたExploreNetは、報酬が観測される前に、現在の潜在表現、デノイジングステップ、およびプロンプトから各潜在要素に対するノイズスケールを予測するポリシーとして機能する。これは、各ロールアウトグループの報酬の広がりに基づいて学習され、推論時には破棄されるため、最終的な推論プロセスには変更を与えない。

具体的には、Stable Diffusion 3.5 Medium上での評価において、ExploreNetは既存のFlow-GRPOと比較して、GenEval2ベンチマークで14%の改善を示した。また、2つの独立した合成ベンチマークと5つの選好・画像品質モデルに転移可能であることが確認され、人間による選好評価では67.2%の勝率に達した。

論文の著者には、シューユエ・ステラ・リー (Shuyue Stella Li) 氏、シャオチュアン・ハン (Xiaochuang Han) 氏、ユリア・ツヴェトコフ (Yulia Tsvetkov) 氏、ルーク・ゼットレモイヤー (Luke Zettlemoyer) 氏が名を連ねている。このグループ相対拡散強化学習の実験全体を通して、探索が学習可能であること、探索分布の形状がその大きさを上回ること、そしてロールアウトの品質が量よりも効果的であるという知見が得られた。


参考: arXiv cs.CV (アーカイブ) — 2026年10月1日 13:00 (JST)

原文ハイライト

"ExploreNet: Learning Where to Explore in Diffusion GRPO"

この記事をシェア
X はてブ LinkedIn