ExploreNet、拡散強化学習の探索を改善 生成モデルで性能向上
arXiv cs.CVは2026年9月30日(現地時間)、論文「ExploreNet: Learning Where to Explore in Diffusion GRPO」を発表した。この論文は、グループ相対強化学習(GRPO)手法を用いた画像生成モデルの探索において、適応的な探索分布を学習する「ExploreNet」の導入を報告している。Stable Diffusion 3.5 Mediumを用いた評価では、既存手法Flow-GRPOと比較してGenEval2で14%の性能向上を達成し、人間による選好評価で67.2%の勝率を記録した。