arXiv cs.CV は7月21日(現地時間)、ジェネレーティブ画像生成における領域制御に新たな手法を導入する論文を公開した。この論文によると、Diffusion Transformers (DiTs) に「appearance pointers」と呼ばれる機能を導入することで、テキストプロンプトのみでは困難だったマテリアルやオブジェクトの識別、空間配置といった要素の正確な領域制御が可能になる。これにより、クリエイティブ分野の専門家が求める高精度な領域制御の課題解決を目指す。

この研究は、Diffusion Transformers (DiTs) にネイティブで取り込まれるテキストや画像由来のトークンだけでは、高精度な領域制御が困難であったという課題に対応するものです。

導入されるappearance pointersは、ユーザー指定のマスクにテキストまたは画像入力を合わせることで、DiTsが適切な空間位置で正確な外観の手がかりを導くコンパクトなトークンとして機能します。これらのポインターは、region correspondence networkによって生成され、spatial aggregation mechanismを通じて洗練されることで、トークン負荷を大幅に増加させることなく複数の領域記述を扱えるようになります。

本アプローチは、ベースモデルを最初から再訓練することなく、DiTsにおけるローカライズされたマルチモーダル制御のための初のモダリティ非依存インターフェースを導入します。提案された単一モデルは、様々な評価指標においてモダリティ特化型最先端手法の性能に匹敵またはそれを上回る結果を示しており、生成画像合成における高精度で領域認識型のマルチモーダルガイダンスへのシンプルかつ拡張可能な道筋を提供するとされます。

論文の著者には、Rahul Sajnani、Yulia Gryaditskaya、Radomír Měch、Srinath Sridhar、Matheus Gadelhaが名を連ねています。


参考: arXiv cs.CV — 2026年7月22日 02:59 (JST)

この記事をシェア
X はてブ LinkedIn