arXivは9月22日(現地時間)、Vision-languageモデルを用いた協調運転の質問応答と計画評価に向けた新ベンチマーク「CoVLM-Bench」を提案する研究論文を公開した。車両とインフラストラクチャが連携する実世界のシナリオを対象とし、関連モデル「CoVLM-Drive」も同時に提示している。
自動運転向けVision-languageモデル(VLMs)の研究は、これまで車両単体の視点(ego-centric scenes)を前提とした評価が中心だった。インフラ側のセンサーが捉える観測データは車両の視界を超える情報を含むが、従来の協調運転システムではこれらを幾何学的表現に変換した上で扱う手法が主流だったという。研究チームは、VLMsに車両とインフラの複合ビューを直接組み込むことで、協調的なシーン理解や経路計画の精度向上が見込めるとしている。
論文によれば、質問応答と経路計画を同一の実世界データセット上で、車両とインフラの複合シーンを対象に同時評価した例はこれまで存在しなかった。CoVLM-Benchはこの空白を埋めるベンチマークとして設計されており、協調運転の質問応答(CDQA)と協調計画(CP)を、車両・インフラのペアシーンで評価する構成を取る。
データセットには、シーンに紐付いたCDQAアノテーション、補助的な教師情報となる3部構成の根拠データ、記録された自車両の走行軌跡から導出した将来経路ターゲットが含まれる。規模は2,196組のペアフレーム、35,136件のCDQAアノテーションで、CPタスクは3秒間の時間枠で6つのウェイポイントを予測する設計となっている。アノテーション作成には、モデル支援によるドラフト生成、走行記録に基づく計算処理、人手による検証を組み合わせた手法が用いられた。
このベンチマークを基盤に、研究チームは統一VLMベースライン「CoVLM-Drive」を提案した。CDQAとCPの両タスクに車両・インフラのペアビューを直接入力する構成が特徴となる。論文が示す実験結果では、CDQAタスクへの適応によって回答精度が向上し、CoVLM-Driveは比較対象としたV2Xプランナーよりも低い最終変位誤差(FDE)を達成したという。加えて、QA初期化と根拠データによる教師情報が、それぞれ独立して計画誤差の低減に寄与することも確認されたとしている。
研究チームは、CoVLM-BenchとCoVLM-Driveが、協調的なシーン理解と計画に関するVLMsの学習および比較手法を支える基盤になり得るとしている。論文はarXiv(https://arxiv.org/abs/2609.35823)で公開されている。
参考: arXiv cs.CV — 2026年9月30日 13:00 (JST)
原文ハイライト"CoVLM-Bench: A Real-World Benchmark for Cooperative Driving Question Answering and Planning"