長文推論向け蒸留手法「GC-OPD」を提案、Qwen3モデルの性能向上を確認
arXivが2026年8月19日(現地時間)付けで報じたところによると、Zhu Zhang氏らの研究チームは、長文コンテキスト推論におけるオンポリシー蒸留 (On-policy distillation、OPD) の課題を解決する新手法「Group-Calibrated On-Policy Distillation (GC-OPD)」を発表した。この手法は、教師モデルのトークンレベルのガイダンスとタスク固有の検証器 (verifier) 報酬との不一致を解消し、モデルの性能向上を目指す。既存のQwen3-4BおよびQwen3-8Bチェックポイントに適用した結果、複数のベンチマークで平均スコアが大幅に改善されたと報告されている。