arXiv cs.CVは9月30日(現地時間)、内視鏡動画からカメラパラメータ、稠密な幾何情報、および3D組織軌跡を一度のフォワードパスで予測する「SCOPE-4D」を発表した。単眼RGB動画を基にこれらの情報を同時に生成する、内視鏡用の4D幾何学基盤モデルとして開発された。本モデルは、内視鏡幾何学学習の二つの主要課題に対応する。
SCOPE-4Dは、幾何学アノテーションの不足と、カメラの動きおよび組織変形間の曖昧さという、内視鏡幾何学の学習における二つの課題に対処する。研究チームは、実データと合成データを含む消化器内視鏡検査および腹腔鏡検査の約5,000クリップからなるデータセット「SCOPE-5K」を構築した。
SCOPE-5Kを用いた幾何学的教師ありファインチューニングにより、内視鏡の事前知識を学習し、カメラおよび深度推定の精度が向上する。さらに、Common-Residual Motion (CRM) は、一般的な組織の動きに対する局所変形を制約する。幾何学的教師あり学習、CRM、および軌跡教師あり学習を組み合わせることで、幾何学的ファインチューニング単独と比較して、カメラおよび深度推定がさらに改善され、稠密な3D組織追跡が可能となる。
パブリックベンチマークおよび新規に収集されたベンチマークでの評価では、ドメイン内およびドメイン外における強力な幾何学性能、優れた3D追跡能力、そしてより安定した長尺結腸再構成が示された。ブラインドユーザー調査は、実際の臨床動画における再構成品質を支持する結果となった。これらの成果は、大規模な内視鏡教師あり学習とモーション制約が、幾何学的推定と組織追跡において価値があることを示している。
本研究は、Chaoyi Zhou氏、Zhongpai Gao氏、Anwesa Choudhuri氏、Meng Zheng氏、Benjamin Planche氏、Run Wang氏、Terrence Chen氏、Siyu Huang氏、Ziyan Wu氏によって共同で執筆された。
参考: arXiv cs.CV (アーカイブ) — 2026年10月5日 13:00 (JST)