arXivは7月16日(現地時間)、Jiacheng Liu氏とJason Liu氏らが、高解像度動画拡散モデルのメモリ効率を大幅に改善する新手法「MegaSlide-DiT」を発表しました。この手法は、単一のH200 GPUと1.5TBのホストRAMを用いて、1050億パラメータを持つDiffusion Transformer (DiT) の適応を実証しています。これにより、既存の大規模生成モデルが直面するメモリ制約を克服する道筋が示されました。
大規模なDiffusion Transformer (DiT) は、1000億を超えるパラメータと1テラバイト以上の永続的な状態を必要とします。論文では、ナイーブな時空間自己アテンションがシーケンス長に対して二次的に増加するため、パラメータメモリとアクティベーションメモリの二つの制約が、大規模GPUクラスターなしでの大規模生成モデルの適応を妨げていたと指摘されています。
MegaSlide-DiTの主要な洞察は、GPUがモデルの全状態を保持する必要はないという点にあります。永続的な重み、マスター重み、およびオプティマイザのモーメントは全てホストメモリに保持され、一時的に必要なシャードのみがオンデマンドでGPUにストリーミングされる仕組みが採用されています。
さらに、二次的に増加するグローバルアテンションは、モーション適応型のローカルアテンションオペレータである3D Deformable Slide Attention (3D-DSA) に置き換えられました。この変更により、メモリと計算複雑度の両方がシーケンス長に対して線形に削減されます。
論文では、設計を裏付ける詳細なメモリ会計、実行トレース、および評価結果が報告されています。MegaSlide-DiTは、単一GPUで105Bモデルを一から訓練すると主張するものではなく、帯域幅の限界を魔法のように解決するものでもありません。むしろ、ハイエンドワークステーションを用いて大規模動画拡散モデルの全パラメータ適応を行うための実用的な道筋を提供するものとされています。
参考: arXiv cs.CV (アーカイブ) — 2026年7月28日 13:00 (JST)