学術論文リポジトリのarXiv cs.CVは2026年10月8日(現地時間)、高ダイナミックな実世界ストリームにおける動画大規模言語モデル(VLM)の知覚能力を評価する新たなベンチマーク「FastBench」に関する論文を公開した。既存のVLM向けベンチマークが低ダイナミックなシナリオに限定される中、FastBenchは高フレームレート(FPS)クリップからの質疑応答(QA)生成、SAM3とCoTracker3による回答検証、人間の検査を組み合わせたパイプラインを採用し、モデルのより現実的な性能評価を目指す。
本論文は、限られたコンテキスト予算内で、VLMが時間履歴、空間解像度、時間粒度のバランスを取ることの重要性を指摘している。従来のベンチマークは1〜2FPS(フレームレート)の疎なサンプリングに焦点を当てており、この手法では高速なイベントを見逃すリスクがあると警告している。
FastBenchは、8つの異なるドメイン、6つの能力、および順方向、瞬間、逆方向の時間的スコープにわたる306組の質疑応答(QA)ペアで構成される。これらのQAペアには、人間がアノテーションを付与したエビデンス区間が含まれており、詳細な検証が可能だ。さらに、FastBenchではテキストトークンを介して入力フレームレートを調整する、トレーニング不要のベースライン「ProactiveFrame」も提案されている。このProactiveFrameは、二層スライディングウィンドウ方式を採用しており、最近の高FPS観測を保持しつつ、古い観測を疎な履歴にダウンサンプリングすることで、効率的なデータ処理を実現する。
実験の結果、最新のモデルであっても、高ダイナミックなストリーム理解には課題が残ることが明らかになった。最も強力なモデルの一つであるGemini-3.5-Flashでさえ、FastBenchでのスコアは50.7%に留まった。Qwen3-VL-8Bは、2FPSでの32.9%から24FPSでは44.6%へとスコアが向上したものの、履歴が圧縮されると性能向上が飽和する傾向が見られた。ProactiveFrameは、疎な均一サンプリングと比較して5.4パーセンテージポイント、および1.5パーセンテージポイントの上回る性能を示したが、オラクルガイドによるフォーカシングの性能には遠く及ばなかった。この結果は、現在のVLMがストリーム単独でより高精度な時間的知覚が必要な時期を判断するのに苦慮している現状を示唆している。
FastBenchは、高ダイナミックなストリーミングビデオ理解のための新たなテストベッドとしての役割を果たすと位置付けられている。
参考: arXiv cs.CV (アーカイブ) — 2026年10月9日 02:55 (JST)
原文ハイライト"Can Streaming VLMs Perceive High-Dynamic Real-World Streams?"