arXiv cs.AIは2026年9月30日(現地時間)、大規模言語モデル(LLM)エージェントの自己改善能力向上に向けた新たな枠組み「AREX-2」を提示した論文を公開した。論文は、自己改善能力をテスト時にソリューションを反復的に改良する力と定義し、「反省」と「長期的実行」という相補的な2つの能力に基づくと説明している。これらの能力はドメインに依存せず、監視に適したシナリオで学習可能であるとの仮説が立てられている。
研究チームは、機械学習タスクとアルゴリズムプログラミングタスクの双方から、長期間にわたる改善の軌跡を合成したデータセットを構築した。両ドメインを選定した理由として、検証可能なフィードバックが得られる点と、持続的な反復が可能な点を挙げている。
このデータを用いて、Qwen3.8-27Bを基盤とするエージェントを訓練した。評価の結果、機械学習エンジニアリングのベンチマークであるMLE-bench Liteでスコア81.8、プログラミング関連のベンチマークであるFrontier-CSでスコア70.7をそれぞれ記録した。
訓練済みのエージェントは、検索や調査を伴う深層研究タスクにも適用された。ウェブ検索を伴う評価用ベンチマークBrowseCompで84.0、専門分野の難問を集めたHLE(Humanity’s Last Exam)で52.6、複数ステップの推論を要するGAIAで92.2、検索に基づく質問応答を評価するDeepSearchQAで93.8のスコアを、それぞれ記録した。いずれのタスクでも、エージェントに割り当てる推論ラウンドの予算を増やすほどスコアが向上する傾向が確認されたという。
研究チームはこの結果について、機械学習とプログラミングという検証可能な領域で合成した長期的な反省的データによる訓練が、ドメインを問わず自己改善エージェントを実現するための有効な経路となる可能性を示すものとしている。一方で、今回示されたスコアは特定のベンチマーク群における評価結果であり、実運用環境での再現性や汎用性については、今後さらに検証が進む可能性がある。
論文AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasksは、arXiv cs.AIに2026年9月30日(現地時間)付けで公開された。原文はarxiv.org/abs/2609.38288で閲覧可能である。
参考: arXiv cs.AI — 2026年10月1日 13:00 (JST)