大規模言語モデルのオンポリシー蒸留、単一クエリでも効率改善
ジースアン・フー (Zixuan Fu) 氏らの研究グループは2026年9月3日(現地時間)、学術論文公開サイトarXiv cs.AIを通じ、大規模言語モデル (Large Language Models) の「オンポリシー蒸留 (On-policy distillation, OPD)」における訓練データの役割に関する研究結果を発表した。単一のクエリを用いた訓練 (one-shot OPD) でも、数百ステップにわたる改善が見られ、広範なタスクドメインやモデルファミリーにおいて、全データを用いたOPDとほぼ同等の効果が得られることを示した。