arXiv cs.ROは9月24日(現地時間)、タスクおよびモーションプランニング (TAMP) 問題に対するコーディングエージェントの有効性を示す論文を公開した。同研究は、コーディングエージェントがプログラムを合成し、未知のインスタンスに汎化する能力を持つことを検証。クロード・コード (Claude Code) (Opus 5) およびCodex (GPT-5.6 SolとGPT-6 Astra) を用いた評価では、手動設計プランナーや既存の計画ベースラインを平均成功率で上回ったと報告している。

タスクおよびモーションプランニング (TAMP) 問題は、離散的な意思決定と幾何学的、運動学的、動的な制約が密接に結合しており、依然として解決が困難な課題として認識されている。汎用TAMPは、問題インスタンス間の規則性を利用することで、新しいインスタンスでの計画作業を削減し、この困難に対処しようとするアプローチだ。しかし、これまでの手法では、TAMP固有の高度なエンジニアリング作業が必要とされていた。

論文は、コーディングエージェントがインスタンス間で汎化するプログラムを合成することで、このプロセスを自動化できるかどうかの調査を行った。研究では、タスク記述とシミュレーターへのアクセスが与えられた場合、各エージェントが固定されたプログラム合成予算内で環境と相互作用し、プログラムを開発する仕組みを採用した。開発されたプログラムはその後、固定され、以前には認識されていない未知のインスタンスでその性能が評価された。

評価には、クロード・コード (Claude Code) (Opus 5) およびCodex (GPT-5.6 SolとGPT-6 Astra) が使用された。これらエージェントは、キンダー (KinDER) および PDDLストリーム (PDDLStream) の合計28のシミュレートされた環境でテストされた。評価ベンチマークには、元のベンチマークで評価されたオブジェクト数を超えるオブジェクト数が含まれていた。すべてのプログラム合成方法において、980の生成されたプログラムがそれぞれ100の保持されたインスタンスで評価され、合計98,000回の評価エピソードが実施された。

全体として、コーディングエージェントは汎用TAMPにおいて有効であることが確認された。使用された3つのエージェント設定は全て、手動で設計されたプランナー、ワンショット生成、および大規模言語モデル (LLM) ベースの汎用計画ベースラインを平均成功率で上回る結果を示した。プランナーが利用可能な16の環境に限定した場合、エージェントの成功率は56%から95%の範囲であったのに対し、プランナーの成功率は47%に留まった。

オブジェクト数が増加するシナリオにおいても、エージェントのプログラムはプランナーよりも高い成功率を維持した。また、インスタンスあたりの計算量は平均で1桁少ないことが示された。ログの分析からは、エージェントが環境との相互作用を積極的に利用し、物理モデルを調整したり、エッジケースをテストしたり、戦略を洗練させたりしている様子が確認された。今回の研究成果は、コーディングエージェントが汎用TAMPの強力なベースラインとして機能する潜在能力を持つことを示唆している。


参考: arXiv cs.RO (アーカイブ) — 2026年9月25日 02:53 (JST)

この記事をシェア
X はてブ LinkedIn