Apple ML Researchは2026年8月4日(現地時間)、画像生成に用いられる拡散トランスフォーマー(DiTs)における外れ値トークンの問題とその制御に関する研究成果を発表した。先行研究ではVision Transformers(ViTs)が少数の高ノルムトークンを生成し、不釣り合いな注意を引きながら限定的な局所情報しか持たないことが示されていたが、生成モデルでの役割は不明瞭だった。本研究は、この現象がRepresentation Autoencoder (RAE)-DiTパイプラインのエンコーダーとデノイザーの両方で発生することを示している。

研究によると、事前学習済みViTエンコーダーは外れ値表現を生成し、DiTs自体も特に中間層で内部的な外れ値トークンを発生させることが明らかになった。単に高ノルムトークンをマスキングするだけでは性能が改善しないことから、問題は極端な値だけでなく、破損した局所パッチセマンティクスに密接に関連していると指摘されている。

この課題に対処するため、Apple ML ResearchはDual-Stage Registers(DSR)と呼ばれるレジスタベースの介入手法を導入した。DSRは、利用可能な場合は訓練済みレジスタ、それ以外の場合は再帰的テスト時レジスタ、そしてデノイザー用の拡散レジスタで構成される。

この介入手法をImageNetおよび大規模なテキスト-画像生成に適用した結果、外れ値によるアーティファクトが継続的に減少し、生成品質が向上することが確認された。この成果は、より強力なDiTsを構築する上で、外れ値トークン制御が重要な要素であることを示唆している。


参考: Apple ML Research (アーカイブ) — 2026年8月5日 09:00 (JST)

原文ハイライト

"We study outlier tokens in Diffusion Transformers (DiTs) for image generation."

この記事をシェア
X はてブ LinkedIn