アンソニー・フラー(Anthony Fuller)氏らは9月30日(現地時間)、自己教師あり学習(Self-supervised learning, SSL)の進展を目指す新たなオートエンコーダーフレームワーク「マスクド・スウィンガーズ(Masked Swingers)」を発表した。このフレームワークは、既存のマスクド・オートエンコーダー(Masked autoencoders, MAE)に主要な改良を加え、特に画像分類ベンチマーク『ImageNet-1K』のkNNタスクにおいて、MAEを3〜5%上回る性能を示し、その有効性が確認された。
Masked Swingersは、従来のMAEとは異なる独自のアーキテクチャを採用している。この手法では、まず入力画像を2種類の異なるデータ拡張(データオーグメンテーション)手法で加工する。その後、それぞれの拡張されたビューを個別にマスク処理し、エンコーダーを介して特徴表現を抽出する。このプロセスにおいて、特に重要なのが、ビュー間でグローバルな表現であるCLSトークンを交換するメカニズムである。これにより、モデルは個別のビューに強く依存しない、よりロバストで普遍的な画像要約を学習することが可能となる。最終的に、交換された表現を用いてマスクされたパッチをデコードすることで、完全な画像を再構築する。
研究チームが行った広範な実験の結果、Masked Swingersは多岐にわたるタスクでMAEを大きく凌駕する性能を発揮した。例えば、インスタンス検索タスクではMAEに対して相対的に45%の性能向上を達成。動物の再識別(animal re-ID)タスクでは22%の向上、手書き文字認識のベンチマークであるOmniglotでは76%もの大幅な性能向上を示した。
さらに、この研究では「状態プロービングデータセット」と呼ばれる3つの新しいデータセットが導入された。これらのデータセットにおける評価では、Masked SwingersはMAEと比較してエラー率を相対的に64%削減し、その能力を実証した。このような優れた性能は、モデルが複雑な環境や相互作用を理解し、予測する「world modeling」のような高度なAI能力を開発する可能性を秘めていると論文では指摘されている。研究者たちは、ビューに依存しない表現学習と効率的な転送学習の促進が、Masked Swingersの汎用性と高性能の鍵であると結論付けている。
参考: arXiv cs.CV (アーカイブ) — 2026年10月1日 13:00 (JST)