自己改善LLMに新枠組み、「SPEE」が数学ベンチマークで既存手法を凌駕
arxiv.orgは2026年8月2日(現地時間)付けで、大規模言語モデル(LLM)の自己改善に関する新たな研究論文「Self-Improving Large Language Models via Progressive Experience Evolution」を公開した。同論文は、既存のテスト時と訓練時手法のギャップを埋める「Experience Distillation」という中間段階を導入したフレームワーク「SPEE (Self-Progressive Experience Evolution)」を提案。SPEEは、5つの数学的推論ベンチマークで既存の自己改善ベースラインを上回る性能を示したと報告している。