Google Researchは9月29日(現地時間)、画像生成AIにおけるプロンプトアライメントを改善し、統一的かつ簡素化された制御を可能にする軽量なネットワーク「ディフュージョン・コントローラー (Diffusion Controller)」を発表した。このネットワークは、既存のテキスト-画像AIモデルに容易に組み込め、基盤モデルの安定性を損なうことなく画像品質を高める。生成プロセスを連続的な制御問題として再構築し、より精密なユーザー意図への対応を目指す。
Googleのソフトウェアエンジニアであるチーウェイ・シュー (Chih-wei Hsu) 氏とムンギョン・リュウ (Moonkyung Ryu) 氏が共同で導入したディフュージョン・コントローラーは、「ステアリングダンパー」ネットワークとして機能する。この技術は、Nano BananaやStable Diffusion、フリュクス (Flux) といったテキスト-画像AIモデルの急速な進化によって可能になった高忠実度画像の生成において、ユーザーの意図や視覚的制約にモデルを正確に誘導する際の課題に対処する。
既存の画像生成ガイド手法は、推論時テクニック(例: classifier-free diffusion guidance)や、LoRA、reward-weighted regressions、policy gradientsを用いた重いファインチューニングなど、個別の解決策として扱われてきた。これにより、生成モデルの制御に関する統一された数学的言語が不足しており、エンジニアはユーザーの好みと画像品質のバランスを取る際に推測に頼ることが多かった。
ディフュージョン・コントローラーフレームワークは、画像生成プロセスを分離されたステップの連続ではなく、滑らかで連続的な制御問題として再定義する。この軽量なアドオンネットワークは、人間の好みとの一致において業界標準を上回る性能を示した。また、「white-box」アクセス(内部モデルウェイトの変更が許可されたファインチューニングモデル)を伴うバージョンでは、ベースラインモデルに対して90%の勝率を達成した。
このフレームワークは、AIモデルのコアエンジンに直接手を加えることなく、外部から生成プロセスを調整する。例えば、「サングラスをかけたトカゲ」というプロンプトに対し、サングラスの組み込みを確実にする一方で、トカゲの顔が歪むことを防ぐガードレールが機能する。理論を実践に移すため、Method 1: Policy gradient and PPOとMethod 2: Reward-weightedという二つの効率的なファインチューニング手法が開発された。
ディフュージョン・コントローラーは、アクセスが制限されたblack boxesまたはgray boxesと呼ばれるクローズドソースモデルにも適用できるため、エンジニアは基盤コードに触れることなく、モデルを精密に制御しカスタマイズすることが可能となる。実験では、Stable Diffusionをバックボーンとして使用し、性能を評価した。LoRAを上回る結果を示し、少ない内部モデル層の操作でこれを達成したことは重要な成果とされている。
参考: Google Research Blog (アーカイブ) — 2026年9月30日 03:38 (JST)