Runwayは2026年9月24日(現地時間)、リアルタイムでの動画および音声生成をインタラクティブなシミュレーションに転換する研究プレビュー「GWM Worlds 2」を発表した。同社が提唱する入力形式「WorldPrompt」は、生成される世界とその中のアクションを規定する仕組みであり、継続的なコンテキストと時間指定アクションを用いてワールドモデルを操作し、リアルタイムでの動画・音声生成を目指す。
WorldPromptは、GWM Worlds 2の新機能であり、キャラクター、カメラ、環境を制御するレイヤーとして機能する。これはシミュレートされた環境の特定の側面、特に最初のフレームを固定し、一連のタイムスタンプ付きイベントを作成することを可能にする。イベントやアクションはリアルタイムでプロンプトとして入力できる。RunwayのPrincipal Research ScientistであるRobin Kahlow氏は、コンピュータゲームのように世界内の異なるすべての被写体を制御する方法だと説明した。CTOのKamil Sindi氏によれば、WorldPromptはプログラミング言語ではなくプロンプトメカニズムであり、スクリプト機能や状態制御は提供しないものの、ビデオとオーディオを同期させて、オンデマンドでプロンプト可能な世界を作成できると述べた。
リアルタイムでインタラクティブな動画と音声を生成できるワールドモデルの分野では、Runway以外にもGoogle DeepMindのGenie 3、Odyssey-2 Pro、World LabsのRTFM (Real-Time Frame Model) などが開発を進めている。Runwayは2月の資金調達で3億1500万ドルを調達しており、評価額は53億ドルに達したと報じられている。同社は昨年12月に最初のリリースであるGWM Worldsを発表している。
リアルタイムでの動画・音声生成は複雑であり、Kahlow氏は、モデルがクリップ全体を一度に生成するのではなく、フレームごとに生成すること、そして生成速度をリアルタイムで再生できるほど高速にすることという二つの主要な課題を挙げた。GWM Worlds 2は、720p解像度、24fpsの動画と48,000Hzの音声でリアルタイムのインタラクティブな世界をストリーミング提供する。Runwayは、基盤となるオーディオ・ビデオ生成モデルをWorldPrompt形式に合わせてファインチューニングし、その後オートリグレッシブに生成するようポストトレーニングしている。さらに、蒸留法(distillation methods)を通じてリアルタイム化を進めている。共同設立者兼共同CEOのAnastasis Germanidis氏によると、大きなモデルをより小さなモデルに蒸留するか、または拡散ステップ(diffusion steps)を減らす方法がある。しかし、オートリグレッシブモデルの最大の課題は、生成されたフレームをモデルにフィードバックして次のフレームを生成する際に発生する「エラー蓄積」であるとGermanidis氏は指摘した。Sindi氏は、コンテンツの「無限の生成」を扱う際の課題として、どのコンテキストを保持し、何を破棄するかといった最適化の必要性を挙げた。長期記憶の欠如も「未解決の研究課題」とKahlow氏は述べた。
Runwayが開発する技術の主要なユースケースはゲーム分野であるものの、Kahlow氏はロボット工学の分野でシミュレーション環境を用いてロボットの動作をテストする用途や、エージェントのテストへの応用も可能性として挙げた。
参考: Latent Space (アーカイブ) — 2026年9月25日 10:30 (JST)
原文ハイライト"turns high-fidelity video and audio generation into real-time interactive simulation"