ユスフ・アブドゥルカディル氏は8月31日(現地時間)、arXivに公開された論文を通じ、データ不足に直面するハンセン病病変の合成画像生成において、慢性創傷の大規模データセットからの転移学習が有効であると発表した。同氏は、顧みられない熱帯病に対する機械学習が抱えるデータ不足の課題克服を目指し、生成モデル構築の新たな道筋を示した。
顧みられない熱帯病に対する機械学習の研究は、アルゴリズムではなく、利用可能なデータの不足という本質的な課題に直面している。特にハンセン病の場合、公開されているアノテーション付き画像セットは数百件にとどまり、高品質な生成モデルを訓練するために必要とされる規模には遠く及ばないのが現状だ。ユスフ・アブドゥルカディル氏の研究は、豊富な慢性創傷画像で訓練されたモデルが、このようにデータが少ない領域にも効果的に転移できるかという重要な問いに答えるものである。
アブドゥルカディル氏は、この課題を解決するため、三段階からなるパイプラインを構築した。まず、DeepLabV3-ResNet50セグメンテーションネットワークを用いて、マスクを持たない二つの創傷データセットに病変マスクを供給した。次に、Stable Diffusion 1.5のコンポーネントを基にマスク条件付き潜在拡散モデルを組み立て、3,280の関心領域創傷クロップで訓練を行った。この際、UNet入力畳み込み層を4から11チャンネルに拡張し、三つのマスク特徴マップとぼやけた低周波コンテキスト潜在変数を組み込むことで、モデルの表現力を高めた。最後に、約150人の患者から得られた764画像から抽出した708組のハンセン病画像-マスクペアを用いて、このモデルを微調整した。
モデルの評価はLPIPS知覚距離を用いて行われた。生成された画像セットはモード崩壊を示すことなく、その内部知覚多様性(0.662)は、実際のハンセン病画像セットの多様性(0.672、95%信頼区間 [0.664, 0.680])と統計的に区別できないことが判明した。さらに、生成された画像は実際の分布からわずか0.044 LPIPSの距離にあり、これは1標準偏差の半分未満に相当する。微調整は出力分布をわずかに変化させたが、これは病変の幾何学的形状が入力連結のみを通じてネットワークに到達したためと分析されている。
この研究結果は、慢性創傷の写真がハンセン病病変の合成における実行可能なドナー領域であることを明確に示唆している。低レベルの視覚的特徴はうまく転移することが確認され、残る課題は画像品質ではなく、より高度な意味論的制御にあると結論付けられた。
参考: arXiv cs.CV (アーカイブ) — 2026年9月15日 13:00 (JST)