SCAPO、LLM推論精度を向上 半実仮想でトークン信用割り当て
Junshu Pan (ジュンシュ・パン) らは2026年9月30日(現地時間)、arXiv (アーカイヴ) にて、大規模言語モデル (LLM) の推論能力を向上させる「Semifactual Credit-Augmented Policy Optimization (SCAPO)」という新たな最適化手法を発表した。これは、タスクに無関係なプロンプト特徴に対する予測の感度を低減するため、トークンレベルの信用割り当てに半実仮想の安定性を取り入れている。