リサーチ・論文

医用VQAの新たな解析枠組み「MedProb」発表

論文リポジトリのarXiv cs.CLは9月3日(現地時間)、「MedProb: Probing Internal Representations of Vision-Language Models for Medical Question Answering」と題する研究論文を公開した。Erfan Nourbakhsh、Ke Yang、Anthony Riosの各氏が執筆した本研究は、医用画像質疑応答(Med-VQA)における従来の前提に再考を促すもの。MedProbは軽量なプロービングフレームワークとして、凍結されたVision-Language Model (VLM) の内部表現から、フリーテキスト生成なしに多肢選択式のMed-VQAの回答を予測する。

リサーチ・論文

Apple、「LensVLM」を発表 VLM向け圧縮画像テキスト認識精度維持へ

Appleは7月7日(現地時間)、ビジョン言語モデル (VLM) 向けの推論フレームワーク「LensVLM」を発表した。本フレームワークは、レンダリングされたテキストの視覚表現を圧縮しながらも、関連するコンテキストを選択的に拡張することで、テキスト認識の精度を維持する。これにより、高い圧縮率を維持しつつ、VLMの効率的な運用を可能にする新たなアプローチが提示された。

リサーチ・論文

Vision-Language Models、曖昧な入力で女性表現を抑制する傾向

arXiv cs.CVが2026年5月29日(現地時間)付けで報じたところによると、Vision-Language Models (VLM) は、性別が曖昧な入力に対して女性の表現を抑制する傾向があることが、Arnau Marin-Llobet氏らの新たな研究で示された。この研究では、全身装備の作業員や後ろ姿の人物といった曖昧な入力画像に対し、VLMが特定の職業と性別のデフォルト設定を露呈し、強く女性的な職業であっても男性を出力する事例が確認された。

リサーチ・論文

時系列データ異常検出に特化、パラメータ効率に優れた新型VLM「VisAnomReasoner」

Xiaona Zhou氏らは5月28日(現地時間)、研究論文投稿サイトarXiv cs.AIを通じて、時系列データにおける異常検出に特化したVision-Language Model (VLM)「VisAnomReasoner」を開発したと発表した。パラメータ効率を追求したこの新型モデルは、従来のVLMが時系列データの異常パターン検出で抱えていた課題に対応。VisAnomBenchおよびTSB-AD-Uベンチマークにおいて、既存のベースラインモデルを大幅に上回る性能を実証したとしている。