Hui Ren氏らの研究チームは2026年9月29日(現地時間)、長尺動画内のエンティティ追跡を強化する新しい記憶フレームワーク「Grounded Entity Biographies (GEB)」をarXiv cs.CVで発表した。このフレームワークは、視覚的に根拠のある同一物理的インスタンスの観測を、クリップ横断的に「バイオグラフィー」としてグループ化し、質問応答時のモデルの追跡能力を向上させる。本研究では、日単位や週単位の録画を含む4つのベンチマークで評価が行われ、既存の記憶フレームワークと比較して、多肢選択式および自由形式の両方の質問応答において改善が示された。
Grounded Entity Biographies (GEB)は、長尺動画に関する質問に答える際に生じる、複数のイベントにまたがる同一オブジェクトの特定と追跡の課題に対処するために開発された。従来の時系列記述やテキスト由来のエンティティは、異なるオブジェクトが同じ記述を共有したり、同じオブジェクトの観測がイベント間で分断されたりすることで、物理的な同一性の解決が困難になる場合があった。
GEBは、各瞬間における文脈を維持しつつ、複数のクリップにわたる同一の物理的インスタンスの視覚的に根拠のある観測を、検索可能なバイオグラフィーとしてまとめる。質問応答時には、エピソード的な証拠と共にこのバイオグラフィーが検索され、モデルは記憶構築中に確立された同一性リンクを用いて、イベントを通じてエンティティを追跡できるようになる。
評価では、長時間の録画を含む4つのベンチマークで改善が確認された。特にEgoLifeQAでは、GEBが72.0%の精度を達成し、これまでの公開結果で最高のものから4.4パーセントポイント上回った。アブレーション研究(Ablation study)により、根拠に基づいた同一性の関連付けとバイオグラフィーの読み出しの両方が性能向上に寄与しており、単に追加の説明だけではこれらの改善を完全に再現できないことが示されている。
参考: arXiv cs.CV (アーカイブ) — 2026年9月30日 02:59 (JST)
原文ハイライト"Grounded Entity Biographies (GEB), a long-video memory framework that groups visually grounded observations"