学術論文リポジトリのarXiv cs.ROは2026年10月1日(現地時間)、ロボット実行システムの自律的な改善を目指す「Reconstruct, Practice, Go Real (RPG)」フレームワークに関する論文を発表した。RPGは、モデルウェイトを更新することなく、オフラインデータセットから操作能力を特定し、シミュレーション内で関連する練習タスクを構築する。フレームワークは、実行フィードバック、特権的なシミュレーター状態、および利用可能なデータセット動画を活用して失敗を診断し、新たな再利用可能なシンボリックスキルの開発、既存スキルの改良、システムプロンプトの改訂を行う。
RPGは、クロス評価を通じて個々の変更候補と統合された改訂版をテストし、再利用のために保持する。テスト時には、マルチモーダルLLMが、結果として得られたシステムプロンプトとスキルライブラリを用いて、知覚とロボット制御を調整する。
22の操作タスクにおける評価では、RPGは最初の練習ラウンド後のタスク成功率28.6%から、15ラウンド後には95.0%に向上した。これは、ASPIRE (75.5%) やGPT-6 Astra Proを搭載したCaP-Agent0 (60.0%) を含む、評価されたすべてのベースラインを上回る結果を示した。
さらに、一般的なキャリブレーションとハードウェア適応手順を経て、固定されたシステムは3つのタスクそれぞれ10回、合計30回の物理試行すべてで成功を収めた。著者にはイェンジェン・ワン (Yen-Jen Wang) 氏やピーター・アビール (Pieter Abbeel) 氏らが名を連ねている。
参考: arXiv cs.RO (アーカイブ) — 2026年10月2日 02:59 (JST)
原文ハイライト"develops new reusable symbolic skills, refines existing skills, and revises the system prompt"