arXiv cs.CRは2026年10月8日(現地時間)、深層学習モデルの展開後におけるパッチ堅牢性認証に関する研究論文「MRCert」を発表した。この研究では、展開後の深層学習モデルへの入力が敵対的にパッチされている場合に、ラベルの良性認証と高い予測精度を両立させる課題に取り組んでいる。既存のマスキングベース手法が達成できなかったこの両立を、MRCertが初めて実現したと報告されている。
深層学習モデルへの入力は、展開後において意図的に改ざん(敵対的パッチ)される可能性がある。このような入力に対して、既存のパッチ堅牢性認証手法、特にスムージングベースとマスキングベースの防御手法は、ラベルの良性認証と高い予測精度の維持を同時に達成できないという課題があった。スムージングベースの手法は予測精度を著しく低下させ、マスキングベースの手法は敵対的にパッチされた入力の返されるラベルの良性を検証できない問題が指摘されていた。
論文著者であるチーリン・チョウ (Qilin Zhou)氏らは、提案するMRCertがこの両立を可能にする最初のマスキングベースの認定回復防御手法であるとしている。MRCertは、良性サンプルと敵対的パッチサンプルの両タイプの入力に対し、既存手法のように共通の条件を適用するのではなく、タイプ固有の必要なプロパティを推論する。これにより、ラベル回復と認証関数の新しいタイプ指向設計を通じて、ラベルの良性を検証する。スムージングによって引き起こされるクリーン精度低下を回避する設計が特徴である。
実験結果では、MRCertがImageNetデータセットにおいて、パッチサイズ16ピクセルで35.1%の敵対的認定精度 (adversarial certified accuracy) を達成したことが示された。これは、既存の最先端手法であるPatchCUREが完全に失敗した結果とは対照的である。
参考: arXiv cs.CR — 2026年10月9日 13:00 (JST)