arXiv cs.CVが2026年10月8日(現地時間)に公開した論文「One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts」において、Adrian Bulat (エイドリアン・ブラット) 氏らは、単一のTransformerブロックを再帰的に適用することで、中間特徴蒸留なしに全深度ビジョンエンコーダに匹敵する精度を達成する手法「reViT」を発表した。

この研究は、限られた推論FLOPsで全深度ビジョンエンコーダの精度を達成することを目的としている。reViTは、各再帰深度におけるFFN(Feed-Forward Network)を、小規模な共有エキスパートバンクの凸結合として表現することで、深度固有の変換を復元する。連続的な正規化された深度座標がこの混合をプログラムし、FFNパラメータ空間を横断する再サンプリング可能な軌道を定義する。

この設計は、教師ありImageNet-1kトレーニングと、DINOv2教師からの蒸留という二つの体制で評価された。両体制において、制御された適応は、トークンディスパッチや出力混合の代替案よりも、weight-space mergingがマッチするone-FFN予算において最も強力なMoE(Mixture of Experts)ファミリーであることを特定した。

ゼロからトレーニングされたreViT-B/16は、DeiT IIIの精度を達成しつつ、保存パラメータ数を約70%削減した。8エキスパートモデルは、教師の出力特徴のみを使用して蒸留された場合でも、DINOv2教師の線形プローブ精度をほぼすべて維持し、分類、セグメンテーション、深度予測に適用可能であることが示された。Elastic-depth trainingにより、単一のチェックポイント(トレーニング済みモデル)が、同じ正規化された座標区間を再サンプリングすることで、複数のテスト済み深度で動作できるようになる。固定深度デプロイメントの場合、再帰ブロックは従来の密なグラフとして実体化でき、オンラインルーティングとマージが不要になるものの、デプロイメントストレージは拡張される。


参考: arXiv cs.CV (アーカイブ) — 2026年10月9日 02:58 (JST)

原文ハイライト

"a single Transformer block, applied recurrently, can match the accuracy of a full-depth vision encoder"

この記事をシェア
X はてブ LinkedIn