arXiv cs.CVは7月16日(現地時間)、「Online Neural Space Time Memory for Dynamic Novel View Synthesis」と題する研究論文を公開した。本論文は、ストリーミングビデオを用いたオンライン新規視点合成において、動的シーンにおける一時的に隠れた領域の再構築に必要な長期記憶の維持と、リアルタイム処理の厳格な両立という課題に取り組んでいる。Baback Elmieh氏を含む11名の著者が、この技術的障壁を克服する新たなアプローチを提示している。
動的なシーンにおける新規視点合成は、継続的な進展が見られる技術分野である。本研究は、マルチビューのストリーミングビデオからオンラインで新規視点を合成する際に、一時的に隠れた領域を再構築するために不可欠な永続的かつ長期的なメモリ維持と、厳格なリアルタイム処理要件の両立が直面する技術的課題を詳細に検討している。
既存のTest-Time Training (TTT) を用いた標準モデルでは、動的なシーン変化に適応するため、フレームごとに勾配ベースのメモリ更新が必要であった。このアプローチは計算負荷が高く、リアルタイムアプリケーションへの適用を妨げるだけでなく、長期的なコンテキスト維持における不安定性を引き起こす可能性が指摘されていた。
提案されたアプローチは、メモリ更新の頻度とメモリ適用(使用)の頻度を分離する手法を採用している。具体的には、計算コストの高いメモリ更新は定期的に実行される一方、メモリ適用は各フレームで効率的に行われる。この過程で、クロスビューアテンションメカニズムが活用され、異なる視点間の情報を用いて、以前のメモリ状態と現在のフレーム間の変形が効率的に管理される。
さらに、履歴コンテキストを安定的に維持し、壊滅的忘却を防ぐために、二つのメカニズムが導入されている。一つは、シーンの永続的な内部化を促す補助的なMemory Lossである。もう一つは、アクティブな重みがCatastrophic drift(壊滅的忘却)を起こすのを防ぐためのMemory Caching strategyである。本手法は、動的な人間の動きを伴うシーンにおいて、リアルタイムかつ最先端の性能を実証しており、分単位のオンライン記憶化も実現可能としている。
参考: arXiv cs.CV — 2026年7月17日 02:58 (JST)
原文ハイライト"Online Neural Space Time Memory for Dynamic Novel View Synthesis"