arXiv cs.CVは2026年10月3日(現地時間)、Siyu Huang氏らが、画像言語モデルのTest-Time Adaptation (TTA)における既存の課題を解決するため、リスクを考慮したデュアルキャッシング手法「RADC (Risk-Aware Dual Caching)」を発表した。この手法は、信頼性の高いプロトタイプ学習を通じて、背景バイアスや表現変動下でのキャッシュ受け入れにおける信頼性の不足を改善することを目指す。

RADCは、Siyu Huang氏、Yueyong Chen氏、Xuejiao Li氏、Jun Zhou氏らによって提案された。この手法は、ビジョン・言語モデルの推論時適応を強化することを目的としている。

従来のキャッシュベースのTTAでは、グローバルな表現に起因する背景バイアスや、表現の変動下でエントロピーに基づいたキャッシュ受け入れの信頼性不足が課題となっていた。これらの問題は、モデルのロバスト性や汎化性能に影響を与えることが指摘されている。

RADCは、信頼性の高いデュアルキャッシングの導入を通じてプロトタイプ学習を改善する。具体的には、Semantic Foreground Cacheを導入し、CLIP表現からカテゴリに一貫した空間的証拠を集約する。これにより、背景からの干渉を緩和しつつ、グローバルキャッシュを補完する前景プロトタイプを生成することが可能になる。

両キャッシュを確実に管理するため、Gaussian Risk Admissionが採用されている。このメカニズムは、マルチビュー表現を対角ガウス分布としてモデル化し、クラス分離と特徴の不確実性を複合的に考慮する。これにより、信頼性の高いキャッシュ候補が優先的に扱われ、不確実性の高いデータは適切に処理される。RADCは、ゼロショットロジットと、補完的なグローバルおよび前景キャッシュ予測を統合することで、ロバストな推論を実現する。

広範な実験は、クロスドメインおよびアウトオブディストリビューション (out-of-distribution) のベンチマークにおいて、RADCが一貫して最先端 (state-of-the-art) の性能を示すことを実証している。この結果は、RADCが画像言語モデルの推論時適応における新たな解決策を提供する可能性を示唆している。


参考: arXiv cs.CV (アーカイブ) — 2026年10月7日 13:00 (JST)

原文ハイライト

"RADC: Risk-Aware Dual Caching for Vision-Language Test-Time Adaptation"

この記事をシェア
X はてブ LinkedIn