Apple、長尺動画要約向けの新ベンチマーク「LVSum」発表
Appleは2026年7月20日(現地時間)、タイムスタンプを考慮した長尺動画要約の評価用ベンチマーク「LVSum」を発表した。マルチモーダル大規模言語モデル(MLLM)における長尺動画要約の課題に対処するために開発されたもので、13の多様なドメインにわたる72本の動画と、各動画に最大10個の人間が生成した要約で構成される。本ベンチマークは、現在のMLLMが持つ時間的整合性やクロスモーダル一貫性における体系的な弱点を明らかにし、今後のモデル開発の方向性を示唆するものと見られる。