Boyuan Chen氏らは10月4日(現地時間)、画像-テキスト型ジェイルブレイク攻撃の成功に寄与する画像側の要因を分析した研究論文をarXiv cs.CRで発表しました。この研究は、テキストや画像コンテンツ、あるいはそれらの関係に悪意を埋め込むことで機能する、有害なクエリに対するマルチモーダルモデルの脆弱性を調査。攻撃的な画像を用いることで、単独では成功しにくい有害クエリの攻撃成功率が大幅に増加する事例が確認されました。
この研究では、これまで報告された4つの主要な攻撃ファミリーを対象とし、特にStrongREJECTスライスに属する313個のプロンプトを用いて詳細な分析が行われました。評価対象となったのは、5つの異なるマルチモーダルモデルに加え、追加評価としてInternVL3.5-8Bモデルも含まれています。実験を通じて、有害な指示内容は各条件下で一貫して保持され、画像側の特性が攻撃成功に与える影響に焦点が当てられました。
調査結果によると、画像のタイルごとのエントロピーやJPEGサイズといった記述子は、攻撃的なタイルを同サイズで無害な妨害物から確実に区別するものではないと結論付けられました。このことから、画像の密度のみに基づくスクリーニング方法には限界があることが示唆されています。また、以前の研究で示唆されていたタイルカウント構造の役割については、ペイロードの可視性によって結果が不明瞭になっていたことが指摘されました。修正された領域カウントテストでは検出可能な効果が見られず、タイルカウント構造がジェイルブレイクに果たす役割は未解明のままであるとされています。
Qwen3-VL-8Bモデルを用いた詳細な実験では、クエリ固有の関連性を取り除くように設計されたE4操作を適用することで、攻撃成功率 (ASR) が平均して約0.12ポイント低下することが判明しました。この結果は、画像とテキスト間の関連性操作が攻撃成功に限定的ながら寄与している可能性を示唆していますが、画像とテキストの一致性そのものについては、この研究では測定されていません。グローバルな統計的補正を適用した5つのテストのうち、測定された記述子への帰属を明確に支持したのはE4操作のみでした。これにより、画像プロパティと攻撃成功率の間の直接的な因果関係を特定することの難しさが浮き彫りになっています。
参考: arXiv cs.CR (アーカイブ) — 2026年10月7日 13:00 (JST)
原文ハイライト"Which Image Property Carries the Jailbreak? A Controlled Dissection of Image-to-Text Jailbreaks"