Jiuzhou Lin らは9月2日(現地時間)、ビデオ生成モデルにおける人間の嗜好とのアラインメントとモデル蒸留を単一ステージで統合する最適化フレームワーク「DM-Align」に関する研究成果をarXiv cs.CVで発表した。この新手法は、従来手法が抱えていた計算コストの増大やモデルの不安定化といった課題を解決することを目的としている。
ビデオ生成モデルを人間の嗜好に合わせて調整する際、従来の手法では強化学習(RL)に大きく依存しており、これが計算コストの増大という課題をもたらしていた。また、既存のワークフローではRLとモデルの蒸留が別々の段階で実行されており、蒸留前のRL適用は莫大な計算コストを要求し、蒸留後のRL適用はモデルが意図しない振る舞いをする「モデル崩壊」を引き起こす可能性があった。
こうした課題に対応するため開発されたのが、Distribution Matching(DM)に基づく統一された単一ステージ最適化フレームワーク「DM-Align」である。標準的なDMフレームワークは、実際のデータモデルと生成モデル間の分布ギャップを最小化する勾配方向を通じてモデルを更新し、生成されるコンテンツの明瞭さと高忠実度を高める。
DM-AlignはこのDMフレームワークを拡張し、モデルを人間の好むサンプルへと誘導するための補完的な勾配方向を導出する。このアプローチは、DPO(Direct Preference Optimization)やGRPO(Group-based Ranking Preference Optimization)といった先行研究に触発されており、嗜好ペアやグループ内探索から定式化される分布ギャップを活用して、嗜好誘導勾配を直接構築する。これにより、従来のRLに必要だった多段階の報酬評価プロセスや複雑なODE-SDE(常微分方程式-確率微分方程式)変換が不要となる。
研究チームは複数の基盤ビデオモデルを用いて広範な実験を実施した。その結果、DM-Alignが蒸留品質と嗜好アラインメントの両方を堅牢に向上させることが実証された。このサンプル誘導型フレームワークは、単一のバリアントによる最適化や逐次的な2段階パイプラインと比較して、一貫して優れた性能を示している。今回の成果は、ビデオ生成モデルの効率的かつ安定したアラインメント手法の確立に貢献すると期待される。
参考: arXiv cs.CV (アーカイブ) — 2026年9月7日 13:00 (JST)