AcFlowは2026年9月9日(現地時間)、テキストから画像への拡散トランスフォーマー(DiTs)における生成プロセスを精密に制御する新たな推論時手法を発表しました。このコントローラーは、既存のDiTモデルを凍結したまま、中間層の画像トークン活性化を、学習された概念条件付き速度場を通じて操作することで機能します。これにより、生成される画像のスタイル強度を調整したり、特定の不要な概念を抑制したりすることが可能となり、従来の直接的なプロンプトによる制御が抱えていた限界に対応します。
AcFlowは、既存の拡散トランスフォーマー(DiT)モデルに手を加えることなく、推論時(生成時)に画像トークンの活性化を操作するコントローラーとして機能します。これは、入力されたテキスト記述を用いて介入のターゲットを特定し、連続的な制御パラメーターを提供する統合ホライゾンを利用します。システムはトークンごとに変化し、それぞれの活性化状態に依存する更新を生成する速度場を学習します。
この手法の重要な特徴の一つは、AcFlowのパラメーターが各タスクファミリー内で共有される点にあります。これにより、特定の概念に対する微細な記述がサポートされるだけでなく、訓練時に未見だった概念に対しても、個別のフィッティングを必要とせずに高い一般化性能を発揮します。研究チームは、AcFlowの制御メカニズムが、拡散プロセス全体を通じて適応的に機能し、画像トークンの活性化状態に基づいて更新方向を動的に調整することを示しています。
性能評価において、AcFlowはスタイル制御に関する複数の評価指標で優れた結果を達成しました。特に、高スタイルアライメント(スタイル一致度)領域で評価されたベースラインと比較して、最高のスタイルとコンテンツのトレードオフを実現しています。具体的な数値として、固定された運用ポイントにおけるAcFlowのスタイル・コンテンツアライメントは0.5365/0.2860を記録しました。これは、最高のスタイルアライメントを持つ他のベースラインモデルの0.4397/0.2684を上回る結果です。定性的な評価においても、直接プロンプトによる制御では困難だった、多様な概念の抑制が可能であることが確認されました。
詳細な分析からは、学習された速度場が適応的な制御メカニズムとして機能し、更新方向がトークン間で変化し、それぞれの活性化状態に依存することが示されています。AcFlowは、DiTのようなテキストから画像への生成モデルの制御性を大幅に向上させ、より創造的で意図に沿った画像生成を可能にする技術として注目されます。AcFlowの技術を実装したコードは、研究コミュニティ向けにGitHubで公開されています。
参考: arXiv cs.CV (アーカイブ) — 2026年9月11日 13:00 (JST)