VideoMSNは2026年9月30日(現地時間)、arXiv cs.CVに掲載された論文で、動画における効率的な自己教師あり時空間表現学習のためのMasked Siamese Networkフレームワークとして導入された。同手法は、重い3Dアーキテクチャや再構築ベースのオートエンコーダーに頼らず、標準的な画像Vision Transformerを再利用することで、動画をフレームからサンプリングされたスーパー画像として表現する。これにより、ラベルなしデータからの学習を効率化する。
スーパー画像から空間パッチマスキングと時間フレームマスキングの二つのビューを構築し、フレーム間の情報漏洩がないように設計されている。共有のVision Transformer (ViT) エンコーダーが、マスクされたサイアミーズロスを用いて両ビューの埋め込みをアラインすることで、再構築なしに動きと外観の両方の手がかりを捉える。
VideoMSNはデコーダーフリーの定式化により、既存の画像基盤モデルを効率的な動画表現学習に活用する。事前学習済みのDINO-v3とDeiT-v3画像エンコーダーを出発点として、Kinetics-400、UCF101、およびHMDB51の各ベンチマークで最先端の性能を達成した。さらに、従来の動画自己教師あり学習手法と比較して、動画の事前学習エポックを最大で32倍、160倍削減することが報告されている。
提案されたアプローチは、低ショット分類においても強力な性能を示しており、ラベルが不足するシナリオにおける学習済み表現の転送可能性が確認された。本論文はBMVC 2026に受理されている。
参考: arXiv cs.CV (アーカイブ) — 2026年10月1日 02:59 (JST)
原文ハイライト"VideoMSN achieves state-of-the-art performance on Kinetics-400, UCF101, and HMDB51"