視覚情報からの音声解説生成、新手法Cue2Narrateを提案
arXiv cs.CV が2026年9月2日(現地時間)付けで報じたところによると、視覚障がい者向け映画のオーディオ記述 (AD) 生成に関する新たな研究論文が発表された。本論文では、映画の視覚イベントに対して「何を」「いつ」記述するかを同時に予測する2段階のパイプライン「Cue2Narrate (キューツーナレート)」を提案している。従来のAD生成における課題解決を目指し、同手法は新たなベンチマーク上で既存のベースラインを上回る性能を示した。