Apple ML Researchは8月(現地時間)、事前学習済み重みに対する不正な改変を防ぐ新手法「DLR-Lock」を発表した。本手法は、自動微分における推論と学習の非対称性を新たな防御軸として活用し、敵対的な攻撃からモデルの整合性を守る。オープンウェイトの生成AIモデルが普及する中で、事前学習済み重みの不正利用や悪意のある改変に対する懸念が高まっており、その対策が求められていた。
DLR-Lockは、モデル内の事前学習済み多層パーセプトロン(MLP)を、同程度のパラメータ数を持つ深層低ランク残差ネットワーク(DLR-Net)に置き換えることで機能する。この置き換えは、モデルのバックボーンを改変することで、防御層を組み込む。特に、バックプロパゲーション時における活性化メモリの消費が深度に応じて線形に増加する点が特徴である。DLR-Net自体は、モジュールごとの蒸留を通じて効率的に学習されるように設計されており、既存のモデル構造への統合を容易にしている。
この防御機構は、単にメモリオーバーヘッドを発生させるだけでなく、標準的なファインチューニングの最適化ランドスケープにアーキテクチャの不一致を引き起こし、その複雑性を増すことで、攻撃者による重みの改変を困難にする。さらに、前方パス(推論時)に比べて後方パス(学習時)で不均衡なほどのオーバーヘッドを発生させるという特徴を持つ。これにより、悪意のある変更を加えようとする攻撃者にとって、学習プロセスが著しく重くなり、コストが増大する。
Appleは、大規模言語モデル(LLM)を用いた実験で、DLR-Lockが防御戦略を完全に把握した適応型攻撃者に対しても防御に成功し、元のモデルの能力を維持できることを検証したと述べている。この成果は、モデルのパフォーマンスを損なうことなく、セキュリティを向上させる可能性を示唆している。
参考: Apple ML Research (アーカイブ) — 2026年8月6日 09:00 (JST)
原文ハイライト"the inference–training asymmetry of automatic differentiation as a novel defense axis"