arXiv cs.ROは10月6日(現地時間)、Jai Bardhan氏、Josef Sivic氏、Vladimir Petrik氏らが、ロボット操作を目的とした3Dワールドモデル「DepthWorld (デプスワールド)」に関する論文を発表したと報じた。本研究は、従来の動画ベースのワールドモデルが抱える3D幾何学的整合性の課題に対処するため、大規模な3D教師データセット「DROID-3D (ドロイド スリーディー)」と、深度予測を組み込んだ革新的なモデルアーキテクチャを導入している。

データ駆動型ワールドモデルの進化はロボット工学分野において重要性を増しており、ポリシー評価、改善、および計画に不可欠な要素となっている。しかし、現在の動画ベースのワールドモデルはRGB情報のみで学習されるため、各フレームの見た目は正確であっても、一貫性のある3Dワールドを構築できないという根本的な課題を抱えていた。この課題は、ロボットの現実世界での動作の予測精度を低下させる要因となっていた。

研究チームは、この課題を克服するため、二つの主要な側面で進展を示した。第一に、ロボット操作に特化した大規模な3D教師データセットである「DROID-3D」の構築である。DROID-3Dデータセットに対し、高精度なキャリブレーションパイプラインを適用することで、密なメートル法深度情報と再キャリブレーションされたマルチビュー外部パラメータを提供することに成功した。これにより、外部カメラによって取得されたエピソードの90%以上で、0.7ピクセル未満という極めて低い再投影誤差を達成し、データセットの高い品質と信頼性を実証した。

第二に、Stable Video Diffusionを基盤としたワールドモデルである「DepthWorld」の訓練である。DepthWorldは、既存の事前学習済みVariational Autoencoder (VAE)には手を加えず、空間潜在タイル(spatial latent tiling)という手法を通じて、マルチビューのRGB情報と深度情報を同時に予測する能力を持つ。深度教師あり学習を導入した結果、同等の訓練予算でありながら、RGB予測自体が+1.48 dBのPSNR向上を達成した。同時に、正確なメートル法深度を提供することで、ロボットが環境を正確に認識し、幾何学的な推論を行うための基盤を確立した。これらの成果は、ロボット操作におけるワールドモデルの実用性を大きく前進させるものである。

本研究成果は、Conference on Robot Learning (CoRL) 2026において採択された。


参考: arXiv cs.RO (アーカイブ) — 2026年10月7日 02:59 (JST)

この記事をシェア
X はてブ LinkedIn