arXiv cs.CLは2026年7月27日(現地時間)、Tianyi Men氏、Zhuoran Jin氏、Kang Liu氏、Jun Zhao氏らによる「The Physics of Multi-Turn Long-Horizon Planning」と題する論文を公開した。この論文は、基盤モデルエージェントに不可欠なマルチターン長期的計画能力の根本的な改善方法について、統一された制御環境を用いた3段階の体系的な研究を提示している。
既存のモデルが、制御不能で不透明なインターネットデータで訓練されているため、計画能力がどのように獲得、形成、統合されるかを特定することは困難だった。この課題に対処するため、研究チームは精密な制御を可能にする、統一された制御環境を導入し、長期的計画を体系的に研究した。
研究は3つの段階で実施された。
第一に、プレトレーニング(事前学習)中の計画能力の獲得について、データ形式、分布、品質を研究した。CoT状態遷移モデリングを通じた明示的なワールドモデル構築が、より強力な長期的汎化をもたらすことを示した。また、原子スキルのみでは合成的汎化には不十分であり、少量の長期的データが有効であること、そして劣悪な軌跡が長期的なエラー増幅により性能を著しく損なうことを指摘した。
第二に、GRPOとOPDを用いたポストトレーニング(事後学習)による計画能力の形成について検証した。相互情報量を通じて、一般的な計画パターンとタスク固有の計画知識を区別し、ポストトレーニングの3つの適用領域(不必要、有効、非サポート)を特定した。OPDは低品質および長期的な設定下でGRPOよりも広い有効領域を持つことが示された。これはOPDが一貫した更新方向を提供するためである。計画知識に関しては、異なる知識を持つ教師から未知の手順を蒸留すると、新しい知識を完全に確立することなく生徒の以前のワールドモデリングを損なう可能性があることを報告した。
第三に、MOPDポストトレーニングによる計画能力の統合について研究した。マルチティーチャーオンポリシー蒸留(MOPD)が、環境間で共有される計画パターンに収束することで能力を統合することを示した。互換性のあるパターンは環境間汎化を可能にし、部分的に共有されるパターンは継続学習をサポートする一方、完全に矛盾するパターンは深刻な干渉を引き起こすことを確認した。
参考: arXiv cs.CL (アーカイブ) — 2026年7月28日 02:55 (JST)
原文ハイライト"It allows systematically study long-horizon planning across three stages."