Chong Wang氏らは9月29日(現地時間)、画像生成技術「Pixel-space Diffusion Transformers (DiTs)」の効率と品質を向上させる新手法「Persistence Forcing (PerF)」に関する研究論文をarXiv cs.CVで公開しました。この手法は、DiTsの隠れ表現をグローバルな「永続的特徴」と局所的な「活動的特徴」に分類し、それぞれの相互作用を通じて画像生成の安定性と詳細表現の向上を図るものです。

Pixel-space Diffusion Transformers (DiTs) は、高次元の視覚データで直接機能する強力な画像生成モデルです。しかし、その隠れ表現は通常、モデルの深さ全体にわたって均一に洗練される傾向にありました。自然画像は本質的に異なる粒度で構成されており、例えばグローバルな構造は比較的コンパクトに表現できる一方で、ローカルなテクスチャや微細な詳細はより豊かな表現を必要とします。

こうした背景を踏まえ、Chong Wang氏らの研究チームは、ピクセル空間DiTsに異種のリファインメント(洗練)メカニズムを導入しました。具体的には、異なる特徴グループに対し、深さ方向に沿ってそれぞれ異なるリファインメント予算を割り当てています。このアプローチにより、モデルの内部で順序だった特徴の専門化が自然に出現しました。具体的には、比較的まばらに洗練された特徴群は主に画像のグローバルな視覚構造をエンコードする役割を担い、より頻繁に洗練される特徴群は局所的な高周波の詳細表現に特化するようになりました。研究チームはこれら二つの特徴グループを、それぞれ永続的特徴(persistent features)と活動的特徴(active features)と呼称しています。

この出現した特徴の専門化に基づき、Persistence Forcing (PerF)と名付けられた新手法が導入されました。PerFは、ピクセル空間での画像生成において、この永続的特徴と活動的特徴の組織化を明示的に利用します。このメカニズムでは、永続的特徴が活動的に洗練される活動的特徴を継続的に条件付けし、安定したグローバルな情報が、よりきめ細かな視覚的詳細の継続的な洗練を導くように設計されています。画像生成のサンプリングプロセス中、この相互作用はコヒーレント(一貫性のある)なグローバル構造を促進し、classifier-free guidanceを自然に補完するような意味のあるガイダンス方向をさらに誘導します。

ImageNet $256\times256$ の評価ベンチマークにおいて、PerF-LモデルはJiT-Hモデルの半分以下のパラメータ数でありながらFID $1.91$を達成し、JiT-HのFID $1.86$に匹敵する高性能を示しました。さらに、PerF-HモデルはImageNet $256\times256$ でFID $1.63$、ImageNet $512\times512$ でFID $1.76$という優れた性能を達成しています。これらの結果は、PerFが画像生成の効率と品質を同時に向上させる可能性を示唆しています。


参考: arXiv cs.CV (アーカイブ) — 2026年9月30日 13:00 (JST)

原文ハイライト

"allowing stable global information to guide the ongoing refinement of finer visual details"

この記事をシェア
X はてブ LinkedIn