ユンヘン・リウ氏らの研究チームは2026年10月6日(現地時間)、言語による指示でパノラマビデオをリアルタイム生成するモデル「SPW-Nav (A Streaming Panoramic World Model for Language-Guided Navigation)」を発表した。このモデルは、移動指示を解釈し、単一のパノラマ画像から2K解像度の360度ビデオを1分間ストリーミングできる機能を備える。研究チームは、SPW-Navが既存のパノラマジェネレーターやインタラクティブなワールドモデルが抱える課題の解決に寄与すると説明している。
SPW-Navは、対話型3Dシーン探索、バーチャルリアリティ体験、具現化エージェント訓練といった様々な下流アプリケーションに、言語誘導型パノラマビデオ生成が恩恵をもたらすという認識に基づき開発された。
従来のパノラマジェネレーターは事前に定義された軌道に従って動作する。また、インタラクティブなワールドモデルは、パースペクティブビューにおける低レベルなアクションを通じて制御される。これに対し、SPW-Navは、以前に生成されたパノラマ内で受け取った各指示を、カメラの動きとして解釈する独自のアプローチを採用している。
SPW-Navの技術的基盤は複数の革新的なコンポーネントで構成される。一つ目は、球面上での正確な回転を可能にするSpherical rotation decouplingである。二つ目は、長時間のストリームにわたって移動入力が適切な範囲内に維持されるよう保証するpose-aligned conditioningである。そして三つ目は、指示が変更された場合でもシーンの連続性を維持するmulti-term memoryとfew-step generatorが挙げられる。これらの要素が連携することで、安定したリアルタイムストリーミングを実現したとしている。
研究チームはSPW-Navの開発と並行し、パノラマビデオデータセット「SPW-NavSet」も構築した。このデータセットには、詳細なカメラ軌跡と言語による検証済みの指示が含まれており、モデルの訓練と評価に活用されている。SPW-Navは、言語を駆動信号として活用することで、従来のパノラマジェネレーターと比較して優れたカメラ追従精度とビデオ品質を発揮すると、研究チームは説明している。また、オンザフライでの指示切り替えにも対応しており、より柔軟でダイナミックな操作を可能にするとされている。
研究チームはユーザー調査を通じて、SPW-Navが「自由探索」や「指示追従」を含む多様なタスクにおいてその能力を発揮することを実証した。この研究成果は2026年10月6日(現地時間)、論文投稿サイトarXivのコンピュータビジョン分野 (cs.CV) にて公開された。
参考: arXiv cs.CV (アーカイブ) — 2026年10月8日 13:00 (JST)
原文ハイライト"A Streaming Panoramic World Model for Language-Guided Navigation"