Wei Huang氏らは10月7日(現地時間)、リアルタイムのロボット制御における世界の行動モデルの文脈をスケーリングする新たなフレームワーク「Long-WAM(ロングワム)」を発表した。本モデルは、リアルタイム制御の制約下で、因果的な世界の行動モデルのコンテキストを拡張するシステムフレームワークとして提案されている。主要な発見として、ビデオ基盤が自己回帰的(AR)に事前学習されている場合に、より長い履歴が有効であることが示された。
Long-WAM(ロングワム)は、リアルタイムロボット制御において、動作やタスクの進行を推測するために十分な視覚履歴が必要でありながら、その履歴の処理が動作を遅延させるという課題に対応する。研究チームは、行動ラベルなしでロボット動画や一人称視点動画から因果予測を学習し、その履歴から未来への構造を世界の行動適応時に維持する手法を確立した。
実験では、RoboCasa GR-1(ロボカーサ・ジーアールワン)において、コンテキストを0.0秒から19.2秒に増加させることで、成功率が63.3%から78.7%に向上した。一方、双方向で事前学習された初期化では、同様の純増は確認されなかった。ロボットドメインにおける自己回帰的(AR)事前学習は、GR-1およびLIBERO-Long(リベロ・ロング)での最高成功率をさらに高めている。Long-WAMは、LIBERO-Long、RoboTwin 2.0(ロボツイン2.0)、およびDOMINO(ドミノ)における比較手法の中でも最良の結果を達成した。
本システムは、ストリーミング観測エンコーディング、非同期実行、およびハードウェア固有の高速化を採用。これにより、RTX 5090、DGX Spark、およびJetson AGX Thor上で未来予測を中断することなく展開可能となっている。RTX 5090上では、未来の動画潜在予測を含む各アクションチャンクに107.4ミリ秒を要する。Unitree G1およびYAMでのリアルタイム展開は、動的で長期間の操作をサポートし、動的なカップスタッキングでは95%の成功率を記録した。このタスクにおいて、既存手法のPi0.5(パイゼロファイブ)およびFast-WAM(ファストワム)は20回の試行で一度も成功しなかった。Long-WAMは記憶に基づいた実行者として、複合タスクにおける高レベルプランニングを補完する役割も果たす。
参考: arXiv cs.RO (アーカイブ) — 2026年10月8日 02:58 (JST)