Multi-teacher on-policy distillation (M-OPD) における性能不均衡問題の診断と修正を行うフレームワーク「Open-MOPD」に関する論文が、2026年8月19日(現地時間)にarXivで公開されると見られる。同論文は、標準的なM-OPDが活用可能な性能の35.6%しか利用できていなかった問題に対し、Open-MOPDを導入することで、単一の汎用生徒モデルにおける性能回復率を83.4%にまで向上させることが示されたと報告している。
Multi-teacher on-policy distillation (M-OPD) は、ドメイン特化型強化学習 (RL) エキスパートの知識を単一の汎用生徒モデルに統合する有望なパラダイムとして注目を集めている。しかし、M-OPDの最適化ダイナミクスは十分に理解されておらず、厳密に再現可能な手法も不足している現状がある。
この課題に対し、研究チームはSmolLM3-3B-Base上でM-OPDの制御されたベンチマークを確立し、ルーティングの曖昧さから切り離して能力統合を調査した。その結果、標準的なM-OPDは利用可能な性能の35.6%しか活用できていないことが明らかになった。特に、指示追従のような簡潔なタスクにおいては、著しい性能低下と早期の停滞が観察された。同研究では、この問題は勾配衝突ではなく、トークンレベルの最適化予算の深刻な誤配分に起因すると分析している。
誤配分は主に三つの要因によって引き起こされるとされており、具体的にはドメイン間の構造的なシーケンス長不均衡、非均一な学習率による動的収束ドリフト、そして非同期ポリシー更新によるマルチステップ報酬の陳腐化が挙げられる。これらの不均衡を解決するため、研究チームはOpen-MOPDフレームワークを導入したと述べている。Open-MOPDは、トークンシェアのバランス調整、ギャップ認識型動的予算配分、および生徒報酬のリフレッシュ機構を組み込んでいる。これらのメカニズムが連携することでドメイン間のバランスが系統的に回復され、単一の展開可能な生徒モデルにおける性能回復率が35.6%から83.4%へと向上した。研究チームは、このエンドツーエンドの学習後レシピ、学習履歴、評価スイートを学術的にアクセス可能なハードウェア予算で完全にオープンソースとして公開するとしている。
参考: arXiv cs.LG (アーカイブ) — 2026年8月20日 01:50 (JST)
原文ハイライト"Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation"