Vision-Language Models向け3D空間認識フレームワーク発表
文豪・リー (Wenhao Li) 氏らの研究チームは2026年7月23日(現地時間)、arXiv cs.CVに公開した論文で、既存のVision-Language Models (VLMs) が抱える3Dタスクでの課題を解決する新フレームワーク「VLM-IE3D」を発表した。VLM-IE3Dは、RGBビデオから学習した暗黙的および明示的な3D幾何学情報を取り入れることで、VLMsの3D空間認識能力を強化する。
Tag
1 件の関連記事