Xinghao Chen (シンハオ・チェン) 氏らは2026年9月30日(現地時間)、動画シーンテキスト編集の高忠実度な評価を目的としたベンチマークスイート「ViTeX-Bench」を発表した。同ベンチマークは「ViTeX-Dataset」と3軸評価プロトコルから構成され、未開拓分野である動画内の文字編集の課題に取り組む。この発表はNeurIPS 2026のEvaluations and Datasets Trackで受理されている。
動画生成技術の進展にもかかわらず、動画編集、特に元のシーンのダイナミクスを保持しつつ局所的な修正を行う技術は未発達な状態にある。動画シーンテキスト編集は、店舗の看板、ホワイトボード、製品ラベルなど、シーン表面のテキストを周囲のコンテンツ、動き、カメラダイナミクスを維持しながら置き換える技術である。
既存のリソースでは、対になった実写動画データが限られており、一般的な動画編集指標では、要求されたテキストが時間経過とともに正しく保持されるかを直接測定できない課題があった。ViTeX-Benchは、この課題を解決するため、387本の720p実写動画を含むViTeX-Datasetを提供する。このうち230本はトレーニング用の対になった編集データとして提供され、157本は評価用の固定スプリットを形成する。
評価プロトコルは、テキストの正確性、視覚的・時間的品質、および編集の局所性を13の指標を通じて評価する。各軸には主要な指標が一つ設定されており、これらのトレードオフをパレート比較する。OCRキャリブレーション、人間による評価、およびアノテーション感度分析が、これらのスコアの解釈をサポートする。
Xinghao Chen氏らは、4つの編集ファミリーに属する8つのベースラインモデルを評価した結果、正確なテキスト、時間的安定性、およびシーンの保存を同時に達成することは依然として困難であると指摘している。さらに、学習用スプリットでファインチューニングされたオープンソースの参照エディタ「ViTeX-Edit-14B」を公開した。これは、評価された動画ネイティブエディタの中で最も高い平均CharAcc 0.688を達成し、生のエディタ出力におけるテキストクロップWarpの最低値を示している。ViTeX-Benchは、動画シーンテキスト編集におけるこれらのトレードオフを研究するための再現可能な基盤を提供する。
参考: arXiv cs.CV (アーカイブ) — 2026年10月1日 02:59 (JST)
原文ハイライト"Accurate text, temporal stability, and scene preservation remain difficult to achieve together."