arXiv cs.LGが2026年10月7日(現地時間)付けで報じたところによると、Saif Punjwani氏とMicah Goldblum氏は、検証可能な報酬による強化学習(RLVR)における新たな手法として「Exploration-Distillation (ExpDis)」フレームワークを提案する論文を公開した。現代の言語モデルでは、事前に訓練されたチェックポイントにRLVRを適用するが、従来の強力な新規性インセンティブの導入はモデル品質を低下させる課題があった。ExpDisは、探索と最適化のプロセスを分離することで、この問題を解決するとしている。

本論文によると、RLVRの主要な目的の一つは、新しい推論戦略の発見にある。しかし、実際には、新規性に対する強いインセンティブをRLVRに付加しても成功は限定的であり、モデルの品質を低下させる可能性がある。これは、検証可能な報酬がモデルの知識や振る舞いのごく一部しか監視しないため、こうした品質低下からの回復が困難であるためとされている。

提案されたExploration-Distillation(ExpDis)フレームワークは、この問題を解決するため、探索と最適化を分離する。具体的には、まず報酬に新規性ボーナスを付加した1つまたは複数のエクスプローラーポリシー (explorer policies)を訓練する。次に、これらのポリシーが生成した軌跡を正しさ(correctness)と品質(quality)でフィルタリングする。そして、フィルタリングされた軌跡を、別のスチューデントポリシー (student policy)へと蒸留する。このスチューデントポリシーは、新規性ボーナスなしで訓練される。

この手順を数ラウンドにわたって繰り返し、探索と最適化を交互に行うことで、スチューデントポリシーの品質を低下させることなく、探索を積極的に拡大することが可能になるという。ExpDisは、7つの数学的推論ベンチマークと2つのモデルファミリーにおいて、同等の実行時間予算でDAPOを上回る性能を示した。さらに、pass@kのスケーリングが改善されたことから、ExpDisがより多様で正しい解決策を生成するモデルを生み出すことが示されている。


参考: arXiv cs.LG (アーカイブ) — 2026年10月8日 02:59 (JST)

原文ハイライト

"we decouple exploration from optimization in a framework we call Exploration-Distillation (ExpDis)"

この記事をシェア
X はてブ LinkedIn