画像分類器が動画表現学習を効率化、VideoMSNで飛躍的な性能向上
VideoMSNは2026年9月30日(現地時間)、arXiv cs.CVに掲載された論文で、動画における効率的な自己教師あり時空間表現学習のためのMasked Siamese Networkフレームワークとして導入された。同手法は、重い3Dアーキテクチャや再構築ベースのオートエンコーダーに頼らず、標準的な画像Vision Transformerを再利用することで、動画をフレームからサンプリングされたスーパー画像として表現する。これにより、ラベルなしデータからの学習を効率化する。