Yinghua Zhou (インファ・ジョウ)氏らの研究チームは9月24日(現地時間)、論文公開サイトのarXivにおいて、ロボットの動作予測と実行を効率化する新たな手法「ローリングWAM (Rolling-WAM)」を発表した。同手法は、ロボットマニピュレーションにおける行動生成と将来の視覚予測を組み合わせる「ワールド・アクション・モデルズ (WAMs)」のジョイントデノイジングプロセスを複数のリプランニングサイクルに分散させることで、従来のレイテンシー問題を解消し、予測速度を大幅に向上させる。
ワールド・アクション・モデルズ (WAMs) は、ロボットマニピュレーションにおいて、行動生成と将来の視覚予測を連動させるモデルとして知られている。しかし、これまでのWAMsでは、各リプランニングサイクルでビデオと行動の同時デノイジングプロセスを完了させるために大きな遅延が発生し、行動更新の遅れやクローズドループ応答性の制限という課題があった。
Yinghua Zhou氏らの研究チームが開発したローリングWAMは、このジョイントデノイジングプロセスを連続するリプランニングサイクル全体にわたって分散させる手法を採用している。この手法の核心は、ずらされたノイズレベルのビデオ-行動チャンクで構成されるスライディングウィンドウを維持することにある。各ステップで、ローリングノイズスケジュールは、実行対象となる直近の行動チャンクを完全にデノイズする一方で、より遠い将来のチャンクは部分的にのみ洗練される。
新しいカメラ観測によってウィンドウが進むにつれて、保持された将来のチャンクはデノイジングプロセスを継続する。このアプローチにより、計算コストが時間的に分散され、チャンクの境界を越えて進化する視覚-行動コンテキストが保持される。予測範囲全体をゼロからデノイズする必要がなくなるため、標準的なジョイントWAMsと比較して、定常状態のリプランニング速度が4.5倍向上するという。
ローリングWAMの性能評価は、LIBEROやRoboTwinといったシミュレーション環境、さらには実世界のUnitree G1 humanoid (ユニツリーG1ヒューマノイド)を用いて実施された。その結果、ローリングWAMは競争力のあるマニピュレーション性能を達成し、効率的なロボット制御の可能性を示している。
参考: arXiv cs.RO (アーカイブ) — 2026年9月25日 02:58 (JST)