Bingqi Shan氏らは2026年8月18日(現地時間)、arXiv cs.LGに論文「Accelerating Visual On-Policy Distillation with Batched Speculative Jacobi Rollouts」を公開しました。この研究では、Visual On-Policy Distillation (OPD) におけるトレーニングコストの課題に対応するため、バッチ処理に対応した新しいSpeculative Jacobi Decoding (SJD) 手法「HB-SJD」を提案しています。HB-SJDは、コンパクトな視覚自己回帰モデルの学習効率向上に寄与する可能性が示されています。
従来のVisual On-Policy Distillation (OPD) は、現在の学生モデルが生成した軌跡から学習することで、コンパクトな視覚自己回帰モデルのトレーニングを改善する手法です。しかし、これらのオンラインロールアウトは自己回帰デコーディングによりトークンごとに生成されるため、各オンポリシー学習ステップに多大なコストがかかるという課題が指摘されていました。
既存のSpeculative Jacobi Decoding (SJD) は、補助ドラフトモデルなしで複数のトークンを並行処理できる代替手法として知られています。しかし、この元のメソッドは単一シーケンス推論向けに設計されていました。
HB-SJDは、Visual OPD向けのバッチ化されたSJDロールアウトバックエンドとして導入されました。この手法により、各画像は独自のデコーディング進行状況に応じて独立して進行できます。同時に、異なるシーケンス位置にある画像もバッチ処理されたモデルフォワードで検証されます。画像処理が完了すると、HB-SJDは「Full」と「Compact」の実行を切り替え、後のロールアウトラウンドのコストを削減します。HB-SJDは学生ロールアウトバックエンドのみを置き換え、教師モデル、蒸留目標、最適化手順は変更しないとされています。
LlamaGenを用いた実験結果では、HB-SJDがロールアウトとエンドツーエンドのトレーニング時間を大幅に削減しつつ、蒸留された学生モデルの生成品質を維持することが示されました。
参考: arXiv cs.LG (アーカイブ) — 2026年8月20日 13:00 (JST)
原文ハイライト"Accelerating Visual On-Policy Distillation with Batched Speculative Jacobi Rollouts"