論文公開プラットフォームarXivは2026年7月23日(現地時間)、ヴェダント・シャー (Vedant Shah) 氏らが執筆した論文「GraphVid: Interactive Graph-Controllable Video Generation」を掲載した。テキストプロンプトやモーションコントロール入力で多オブジェクト間の正確な相互作用を指定する従来の動画生成の課題に対し、構造化されたインタラクショングラフを通じてインタラクティブな制御を可能にするグラフ条件付き画像-動画生成モデル「GraphVid」を提案。既存手法と比較して、より少ない学習データとパラメータで高い制御性と動画品質を実現したと報告している。

GraphVidの導入は、主にピクセル単位の動きを制約するテキストプロンプトやモーションコントロール入力を用いる既存の動画生成手法が抱える課題に対応するものです。これらの手法では、複数のオブジェクト間の正確な相互作用を指定することが困難であり、特に軌道ベースの制御では、複雑なシーンにおいてユーザーが正確な軌道を描く必要があり、オクルージョン(遮蔽)やオーバーラップ(重なり)がある場合に曖昧さが増すという問題が指摘されていました。

GraphVidは、構造化されたインタラクショングラフを介して柔軟かつ正確な多対象制御を実現します。また、インタラクションを重視した大規模動画データセットであるGraphVid-Bench (グラフヴィドベンチ)も同時に公開され、構造化された関係アノテーションが含まれることで、インタラクション認識型の動画生成モデルの学習を可能にしています。

パフォーマンスにおいて、GraphVidは既存のモーションコントロール手法と比較して、大幅に少ない学習データと少ない学習可能なパラメータで、優れた制御性と動画品質を提供すると報告されています。特にMotion-I2V (モーション・アイツーヴィー)と比較して、FID(Fréchet Inception Distance)を最大39.9%削減し、FVD(Fréchet Video Distance)を37.6%削減しました。また、PSNR(Peak Signal-to-Noise Ratio)を9.87から15.98へ、SSIM(Structural Similarity Index Measure)を0.38から0.61へ改善しています。これらの結果は、構造化されたセマンティックインターフェースが、制御可能な動画生成における強力なパラダイムとなる可能性を示唆しています。


参考: arXiv cs.CV — 2026年7月24日 02:56 (JST)

原文ハイライト

"structured semantic interfaces as a powerful paradigm for controllable video generation."

この記事をシェア
X はてブ LinkedIn