ホンシン・リー (Hongxing Li)氏らの研究チームは2026年10月8日(現地時間)、Vision-Language Models (VLM)の予測的空間推論能力を直接かつ診断的に評価する初のベンチマーク「スペースキャスト・ベンチ (SpaceCast-Bench)」に関する論文をarXiv cs.CVで公開した。既存の空間推論ベンチマークが主に空間知覚能力を測るのに対し、同ベンチマークは観察からシーンを構築し、介入による変化を予測し、見えない結果について推論する、現実世界で求められる空間知能を対象とする。

スペースキャスト・ベンチはobserve-transform-inferフレームワークに基づいて構築されており、182の実世界シーンから抽出された3,862の質問を含む。これらの質問は、静的知覚 (static perception)、局所的予測 (local prediction)、および全体的予測 (global prediction) の3つのレベルにわたる16のタスクタイプで構成される。これらは、シーン理解、空間状態更新、および観察されていない結果に関する関係推論を段階的に要求する。

21のモデルを評価した結果、最も性能の高いモデルでも58.0%の正答率にとどまり、87.2%の人間性能との間に顕著な差があることが判明した。空間に特化したモデルは、ランダムに近い確率であった。

制御された分析により、「bridge views」が分散された観察の統合に不可欠であること、また、生成された結果画像やビデオよりも明示的な3Dエビデンスの方がモデルにとってより信頼性の高い利益をもたらすことが明らかになった。また、プログラム的に生成されたデータでQwen3-VL-4Bを微調整すると、正答率が34.0%から65.7%に向上し、6つのアウトオブドメインベンチマーク全体でマクロ平均のゲインが見られた。


参考: arXiv cs.CV (アーカイブ) — 2026年10月9日 02:44 (JST)

原文ハイライト

"the first benchmark to directly and diagnostically evaluate this capability"

この記事をシェア
X はてブ LinkedIn