Jaewoo Jung氏らが率いる研究チームは2026年9月29日(現地時間)、マルチモーダル大規模言語モデル (MLLM) が回答前に3Dシーンを「想像」する新たな手法「Imagine3D-LLM」を発表した。このモデルは、人間の空間推論に着想を得て、複数の視点からの画像を統合し、コンパクトな3D表現を構築することで、従来のMLLMが抱えていた3D世界の理解における課題克服を目指す。
マルチモーダル大規模言語モデル (MLLM) にとって、複数の視点画像から3D世界を推論することは依然として困難な課題である。現代のMLLMは単一の画像入力には効果的だが、異なる視点からの情報を統合して一貫した3D理解を形成することに苦慮している。この課題を解決するため、これまでは画素レベルのクロスビュー対応を強化したり、3D幾何学基盤モデルの機能を融合したりする研究が進められてきたが、人間の推論との間には大きな隔たりがあった。研究チームは、人間の空間推論を再検討し、詳細な幾何学的手がかりに頼るのではなく、複数の視点から共通のオブジェクトを大まかに識別し、視点間の相対的な幾何学を推測し、シーンの粗い3Dレイアウトを組み立てる過程に着目した。
このプロセスに着想を得て導入されたImagine3D-LLMは、画像トークンの後にlearnable summary tokensと呼ばれる少数の学習可能な要約トークンを追加する。これらのトークンは、光学的再構成損失 (photometric reconstruction loss) によって教師あり学習されたcompact 3D Gaussian Splatting representationへとデコードされ、標準的な次トークン予測 (next-token prediction) 目標と共同で訓練される。要約トークンのみが直接的な再構成監督を受けるものの、この目的はLLMの基盤となる画像特徴量内に、より強力なフレーム間対応を引き起こすことが示唆されている。
結果として、Imagine3D-LLMは複数の空間推論および3D理解ベンチマークにおいて、既存のアプローチを一貫して上回る性能を示した。これは、シーンを「想像する」ことが、画素単位の幾何学情報を与えられるよりも効果的である可能性を示唆している。本研究はNeurIPS 2026で発表される。
参考: arXiv cs.CV (アーカイブ) — 2026年9月30日 02:59 (JST)
原文ハイライト"Imagine3D-LLM, an MLLM that learns to assemble a similar compact 3D representation"