ティアン・シア (Tian Xia) 氏ら複数の研究者は2026年9月30日(現地時間)、マルチモーダル大規模言語モデル (MLLMs) を用いた臨床診断におけるプロンプト最適化手法「Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis」に関する論文をarXiv cs.LGで発表した。この研究では、従来の精度ベースの最適化手法がクラス不均衡な臨床データに不適切である点を指摘し、AUROC (Area Under the Receiver Operating Characteristic curve) を直接最適化する新しい手法「pair-level Pareto prompt evolution (Ranking-PE)」を提案している。
MLLMsは臨床診断において急速な進歩を遂げているが、その適応パイプラインは依然として精度ベースの目標に固定されている。臨床データはクラス不均衡が激しく、多数派を常に予測する手法でも90%以上の精度を達成可能だが、臨床的には有用ではないと指摘されている。
本研究は、クラスバランスに影響されず、陽性を陰性よりも高くランク付けするしきい値フリーのスコアであるAUROCを評価および最適化することに焦点を当てている。従来の反射型手法であるGEPA (Generating Prompts for Adaptive learning) などは、評価インスタンスごとの正誤を記録する二値スコア行列を使用し、その列平均が精度となって候補選択を決定していた。
「Ranking-PE」は、この正誤行を (陽性, 陰性) のインスタンスペアに対するペアワイズ順序付け行に置き換える。候補が陽性をペアの陰性よりも高くスコアリングした場合にセルを1とする。これにより、列平均は経験的AUROCに等しくなる。この置き換えは、パレート優位性を決定するスコア行列、反射型LMへのサンプルごとのフィードバック、および最終的な候補選択という、プロンプト進化探索が読み取る3つの層すべてに適用される。追加のモデル呼び出しや代替損失は発生しない。
MIMICの3つの疾患を対象とした評価では、精度ベースのプロンプト進化がランキングを低下させる可能性が示されたが、「Ranking-PE」はこの状況を逆転させる結果となった。ファインチューニングされたQwen3-VL-8Bでは精度ベースの手法をAUROCで+5.8パーセンテージポイント (pp) 上回り、MedGemma-4Bでは+16.2pp上回る性能を示した。また、医療グレードの視覚バックボーンがプロンプト探索では代替できない前提条件であることも、アブレーション研究により示されている。
参考: arXiv cs.LG (アーカイブ) — 2026年10月1日 02:59 (JST)
原文ハイライト"Ranking-PE reverses this, beating the accuracy-based recipe by +5.8 AUROC pp"