arXiv cs.CVが2026年9月3日(現地時間)付けで、多様なビデオ編集を単一フレームワークで高品質に実現する学習不要のフレームワーク「EditVid」に関する論文を公開した。Adheesh Sunil Juvekar氏らによるこの研究は、命令ベースおよび被写体ベースの編集を統合する新たな手法を提案。EditVidは、sparse causal memory、correspondence-based post-attention token injection、soft latent blendingを組み合わせ、スタイル変換、オブジェクト挿入、被写体置換など多岐にわたる編集を可能にする。
ビデオ編集は多岐にわたるパラダイムを含んでおり、命令ベースおよび被写体ベースの双方で高品質な編集を単一の統一フレームワーク内で達成することはこれまで困難とされてきた。
「EditVid」と名付けられたこのフレームワークは、学習不要(training-free)という特徴を持つ。システムは、ローカルな一貫性(local coherence)のためにsparse causal memoryを採用し、長距離にわたる同一性保持(long-range identity preservation)のためにcorrespondence-based post-attention token injectionを利用、さらに編集の局所性(edit locality)のためにsoft latent blendingを統合している。
これにより、EditVidはスタイル転送(style transfer)、属性変更(attribute modification)、オブジェクト挿入(object insertion)、部分レベル編集(part-level editing)、被写体置換(subject replacement)といった、幅広い種類の命令ベースおよび参照ベースの編集に対応する。性能評価では、FiVEベンチマークにおいて78.16 FiVE-Accを達成し、評価された中で最も強力な学習不要ベースラインの58.95を上回った。また、IVEBenchにおいても競合する結果を示している。
ユーザー調査では、EditVidが7つの競合手法と比較して、総合的に51.8%の好意度を獲得した。本論文の著者には、Adheesh Sunil Juvekar氏、Onkar Kishor Susladkar氏、Kiet A. Nguyen氏、Muntasir Wahed氏、Nabeel Bashir氏、Xiaona Zhou氏、Tianjiao Yu氏、Vedant Shah氏、Ismini Lourentzou氏が名を連ねている。
参考: arXiv cs.CV (アーカイブ) — 2026年9月4日 02:59 (JST)
原文ハイライト"A Unified Training-Free Framework for Diverse Video Editing"