arXiv cs.CVは2026年8月20日(現地時間)、Jai Kumar Sharma氏とAmartya Dutta氏らによる論文を公開しました。この論文は、Zero-Shot Vision-Language Models (VLMs)における分割適合予測の周辺被覆率が、デプロイメントシフトの状況下でクラス条件付きテール被覆率の深刻な崩壊を経験する可能性を指摘しています。

分割適合予測は、交換可能性の下で周辺被覆率を提供する手法であり、ゼロショット視覚言語モデル(VLMs)において拒否層として広く利用されています。

Sharma氏らの研究チームは、CLIP、OpenCLIP、SigLIPといったモデルを対象に、ImageNetおよび非ImageNet設定におけるデプロイメントシフト下での監査を実施しました。その結果、周辺被覆率が比較的高く維持されている一方で、クラス条件付きテール被覆率が崩壊する現象が確認されました。具体的には、ImageNet-Sketchデータセットにおいて、最悪クラスの被覆率が約0にまで低下したと報告されています。また、約10~12%のクラスが有限サンプルのヌルフロアを下回る結果も示されており、このとき、周辺被覆率は約0.86でした。

この失敗は、ターゲットドメインのクラス精度とは一致するものの、テストされたソースドメインの診断法では予測できないことが示唆されました。ソース側Mondrian calibration(モントリアン較正)はイン分布テールを改善するものの、転移性は見られなかったとのことです。さらに、clustered conformal(クラスター適合)やConf-OTといった手法も、周辺または平均的な指標を改善する一方で、最悪クラスのテール被覆率を回復するには至らなかったと結論付けています。ターゲット側クラス較正はテールを大幅に改善するものの、全てのクラスに対してラベルが必要であり、セットサイズ集約的であると報告されています。

研究では、2~3倍のcross-family efficiency gap(ファミリー間効率ギャップ)も特定されており、SigLIPのネイティブなシグモイドスコアがAPSの確率質量解釈を排除することも示唆されました。これらの発見は、テストされたモデルスケール、事前学習コーパス、プロンプト、ミス被覆レベルα、およびシフトした非ImageNet設定全体で持続することが確認されています。

論文は、周辺適合被覆率をクラステールに対する安全性保証ではなく、平均的な信頼性統計量として扱うべきであると結論付けています。 この研究は、ECCV 2026 Workshop on Uncertainty Quantification for Computer Vision (UNCV) で採択されました。


参考: arXiv cs.CV (アーカイブ) — 2026年8月21日 13:00 (JST)

この記事をシェア
X はてブ LinkedIn