Junshu Pan (ジュンシュ・パン) らは2026年9月30日(現地時間)、arXiv (アーカイヴ) にて、大規模言語モデル (LLM) の推論能力を向上させる「Semifactual Credit-Augmented Policy Optimization (SCAPO)」という新たな最適化手法を発表した。これは、タスクに無関係なプロンプト特徴に対する予測の感度を低減するため、トークンレベルの信用割り当てに半実仮想の安定性を取り入れている。
Reinforcement learning with verifiable rewards (RLVR) を用いたLLMの推論能力は向上しているものの、その予測はタスクに無関係なプロンプト特徴に依然として敏感である。Pan らは、半実仮想プロンプト介入によってこの感度を調査し、デコーディング中に高ドリフトのトークン候補を抑制することが、モデルの重みを更新することなく推論精度を向上させることを明らかにした。
これらの発見は、Group Relative Policy Optimization (GRPO) の限界を浮き彫りにした。GRPOは、全ての応答トークンに同じ結果由来のアドバンテージを割り当て、有用な推論と同時に見せかけの依存関係を強化する可能性がある。この観察に基づき、Pan らはGRPOの因果的に着想を得たバリアントであるSCAPOを導入した。SCAPOは、半実仮想介入の下で固定された応答に対するトークン確率のドリフトを測定し、正規化された安定性スコアを用いて、初期トレーニング中に比較的不安定なトークンのアドバンテージを削減する。
Qwen3-4B-BaseおよびQwen3-1.7B-Baseのモデルにおいて、SCAPOはAIME 2024-2026の精度をGRPOと比較してそれぞれ5.63パーセンテージポイント、4.17パーセンテージポイント向上させた。両方のモデルスケールで、SCAPOは評価されたほとんどの数学ベンチマークおよび全てのout-of-distributionベンチマークで最良の結果を達成した。これらの結果は、半実仮想の安定性がRLVRにおけるよりきめ細かな信用割り当てを通じて、推論と汎化を改善する効果的なトレーニングシグナルを提供することを示唆している。関連するコードは公開されている。
参考: arXiv cs.LG (アーカイブ) — 2026年10月1日 02:59 (JST)
原文ハイライト"suppressing high-drift token candidates during decoding improves reasoning accuracy without updating model weights"