VLMの視覚的推論根拠付け「CSGR」を提案 反実仮想介入で領域特定
arXiv cs.CVは9月1日(現地時間)、「Don't Just Look, Intervene: Perturbation Based Region Labeling for VQA Images」と題する研究論文を公開した。同論文は、視覚言語モデル (Vision Language Models; VLM) が回答を導き出す際に依存する視覚的証拠を特定するための、反実仮想的根拠付け領域探索 (Counterfactual Search for Grounding Regions; CSGR) と呼ばれる新しい手法を提案している。CSGRは、モデルの回答分布に因果的に影響を与える画像領域を特定し、VLMの視覚的推論を根拠付ける有用な教師信号を生成することを目的としている。