Kunming Luo氏らは10月2日(現地時間)、arXiv上で単一画像からの構成的3Dシーン生成フレームワーク「DistScene」を発表した。DistSceneは、環境とオブジェクトを明示的なシーンコンポーネントとして同時にモデル化することで、既存手法と比較してシーン全体の空間的な一貫性を向上させる。
DistSceneは、単一の画像から構成的な3Dシーンを生成するため、環境と個々のオブジェクトを共同でモデリングする手法を導入している。
このフレームワークは、以下の三つの主要な要素で構成される。
- Scene-Frame Generation: 共有座標フレーム内で、環境コンポーネントとオブジェクトコンポーネントを独立して共同生成し、それらの幾何学的形状と相対的な配置関係を学習する。
- Object-Centric Refinement: シーン全体のコンテキスト情報を利用して、各オブジェクトをそのローカルフレーム内で洗練するプロセス。
- Object-to-Scene Distillation: 事前学習されたオブジェクト生成の事前知識を、自動的に構成・レンダリングされた合成シーンを通じて、シーン生成タスク全体に転送する。
このアプローチにより、DistSceneはオブジェクトの配置に幾何学的なコンテキストを提供し、より整合性の高いシーン構成を実現する。屋内および屋外の各種ベンチマークにおける評価では、評価対象のベースライン手法と比較して、DistSceneがシーンレベルでの空間コヒーレンスを顕著に向上させることが実証された。
参考: arXiv cs.CV (アーカイブ) — 2026年10月7日 13:00 (JST)
原文ハイライト"DistScene: Object-to-Scene Distillation for 3D Scene Generation"
この記事をシェア