パラズ・ダハル (Paras Dahal) 氏らは2026年9月29日(現地時間)、arXiv cs.AIで「Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning」と題する論文を発表した。同研究は、エージェントがより長く複雑な問題に取り組む際の実行制御の課題に対し、エージェント的メタ推論という推論時ハーネスを導入する。これにより、部分的な作業の選択、新規開始の判断、停止時期といった制御選択が明示的かつ構造化された推論プロセスとなる。
エージェント的メタ推論では、ワーカーがタスクレベルの計算を実行し、コントローラーが実行中に確立された情報を統合する。コントローラーは次の選択肢を探索し、残りの予算下で各選択肢の価値を評価し、永続メモリから引き出されたコンテキストと共に選択された作業をディスパッチする。決定間において、コントローラーは実行の完全な履歴を再生する代わりに、簡潔な記録のみを保持する仕組みを採用している。
ベンチマークテストでは、プログラム再構築を通じた長期的エージェント能力を評価するProgramBenchにおいて、メタ推論はGPT-5.5で71.5%の成果を達成した。これはCodexの58.0%を上回る。また、Opus 4.8では67.2%を達成し、Claude Codeの65.5%と比較して改善が見られた。
抽象的推論、マルチドメインの長期的推論、および証明生成にわたるその他のベンチマークでは、メタ推論は3つのフロンティアモデルの平均で、Direct Control (直接制御) に対して3.6から4.2ポイントの向上を示した。Direct Controlがテストされた予算範囲で停滞するのに対し、メタ推論は改善を継続する特性が確認された。ただし、小さい予算ではオーバーヘッドが性能を損なう可能性も示されている。
Artifact-graph (アーティファクトグラフ) 分析では、以前の作業の再利用が増加し、ほとんどの設定で正しい解決策のカバー率が高まり、最終選択で不均一なゲインが得られることが示された。これらの結果は、エージェントがより長い実行にスケールするにつれて、構造化された制御に計算資源を費やすことの重要性が増すことを示唆している。
参考: arXiv cs.AI (アーカイブ) — 2026年9月30日 02:57 (JST)
原文ハイライト"spending computation on structured control becomes more important as agents scale to longer runs."