arXivは2026年10月1日(現地時間)、画像生成における埋め込み予測の有効性を示す研究論文「Embedding Prediction Helps Image Generation」を公開した。同論文は、拡散トランスフォーマーにおける条件付けの課題に対し、Next-Embedding Predictive Autoregression (NEPA)という新しいアプローチを提案している。NEPAは、連続する埋め込みを予測するトランスフォーマーを訓練し、その予測を画像生成の条件として利用することで、デノイズ段階ごとに条件信号を適応させる。

拡散トランスフォーマーでは、クラスラベルまたはテキストプロンプトが一度埋め込まれ、全てのデノイズ段階で同じ条件が再利用される。本研究では、予測された埋め込みをこの条件として利用できるかという問いを立てている。

Next-Embedding Predictive Autoregression (NEPA)は、シーケンスにおける次の連続埋め込みを予測するトランスフォーマーを訓練する。画像生成において、クリーンな画像はノイズのある画像に続くため、その埋め込みは条件およびノイズのある画像の後の埋め込みとなる。研究チームは、Multi-Embedding Predictionを用いてこれら全ての埋め込みを一度に予測するNEPAモデルを訓練した。

Embedding Conditioned Generationでは、DiTジェネレーターがこれらの予測を条件とする。この条件付け信号はデノイズ段階ごとに再計算され、現在のノイズ状態に適応する。クラス条件付きImageNet 256×256を用いた実験では、ジェネレーターの条件、Multi-Embedding Predictionの設計、および両モデルのスケーリングを検証した。

NEPAモデルは各サンプリングステップに2番目のネットワークを追加する。REPAと組み合わせた最終モデル「NEPA-DiT-XL」は、REPAの約3分の1の訓練計算量でFID 1.32を達成した。


参考: arXiv cs.CV — 2026年10月2日 02:59 (JST)

原文ハイライト

"predicted embeddings can serve as this condition instead"

この記事をシェア
X はてブ LinkedIn