多言語推論転送向け自己蒸留法 RP-OPSD を提案
arXivが2026年8月6日(現地時間)付けで報じたところによると、シンイエ・ワン (Xinye Wang) 氏、ジュンシャオ・リウ (Junxiao Liu) 氏、シュージアン・ファン (Shujian Huang) 氏らは、大規模言語モデル (LLM) の多言語推論転送能力を拡張するための新たな自己蒸留法「RP-OPSD (Reasoning-Pivot-Guided On-Policy Self-Distillation)」に関する論文を公開した。この手法は、推論プロセスにおいて重要な「reasoning pivots」に焦点を当てた特権的な蒸留を行うことで、既存のベースラインやOn-policy self-distillation (OPSD) の派生モデルを上回る性能を示したという。