大規模言語モデルの自己改善フレームワーク「SPADE」を発表
Bo Liu (ボー・リュウ) 氏らは2026年8月19日(現地時間)、arXiv cs.CLで論文を発表し、大規模言語モデル (LLM) の継続的な自己改善を目的とした強化学習 (RL) フレームワーク「SPADE (Self-Play in Adaptive Synthetic Executable Environments)」を提案した。SPADEは、単一のLLMが環境デザイナーと推論エージェントの二役を担い、実行可能なトレーニング環境を自己生成し、推論エージェントがその環境で行動を学習する。実験では、30Bパラメータモデルにおいて既存の固定環境ベースラインを上回る性能を示したと報告している。