Ye Tao氏ら研究チームは2026年8月20日(現地時間)、フェデレーテッドラーニングにおける大規模言語モデル(LLM)のプライバシー侵害を引き起こす勾配逆転攻撃に対する新たな防御手法「AEGIS (Attention-Embedding Gradient Isolation Shield)」を開発したと発表した。この手法は、トランスフォーマーの勾配構造から特定された3つの情報漏洩チャネルを全て閉鎖することで、既存の防御策が抱える課題に対処するとされる。

勾配逆転攻撃は、フェデレーテッドラーニング環境で共有される勾配情報からプライベートな訓練テキストを復元する深刻な脅威であり、協調的なモデル訓練の安全性を大きく損なう可能性がある。研究チームがトランスフォーマーの勾配構造を詳細に分析した結果、プライベートなトークン情報が漏洩する3つの明確なチャネルが特定された。

具体的には、一つ目のチャネルは、アテンション出力投影勾配が入力埋め込みを符号化する低ランク部分空間を露呈させる経路である。二つ目のチャネルは、埋め込み勾配の行ノルムの疎性からトークンの存在が直接的に判明する経路。そして三つ目のチャネルは、MLP拡張勾配が、チャネル1と同様に復元可能な部分空間信号を運ぶ経路である。既存の最先端攻撃は、これらのチャネルを解析的に悪用し、秒単位でほぼ正確なトークン復元を達成していることが確認されている。しかし、これまでの防御策は、最大でも一つのチャネルにしか対処できておらず、モデルの有用性を著しく低下させるか、残りの構造的信号を無傷のままにしていた。

AEGISは、アーキテクチャの変更を一切必要としない、軽量かつ効果的な防御策として提案されている。この手法は、3つの逆伝播パス操作によって、上述の3つの解析チャネル全てを同時に閉鎖する。チャネル1に対しては、アテンション投影パラメータを凍結することで情報漏洩を防ぐ。チャネル2は、埋め込み勾配に調整されたノイズを注入することでマスクされる。そしてチャネル3は、MLP拡張勾配にブロックごとのノイズを注入することで対処される。このマスクされた勾配は、ローカルオプティマイザのステップとサーバーへのエクスポートの両方を駆動するため、いずれの側にもクリーンな信号が保持されることはない。

AEGISの有効性は、11種類のモデルと6種類のデータセットを用いた広範な評価によって検証された。その結果、解析的および最適化ベースの両方の勾配逆転攻撃に対して、トークン復元率をほぼゼロにまで低減しながら、モデルの有用性を維持または向上させることが確認された。チャネル1とチャネル2については形式的な保証が提供されており、メカニズムを完全に知る適応型攻撃者に対しても、防御の有効性が経験的に検証されている。本研究は、2027年のNDSSで採択されており、カメラレディ版が今後公開される予定。


参考: arXiv cs.CR (アーカイブ) — 2026年8月21日 13:00 (JST)

原文ハイライト

"Triple-Channel Gradient Masking for Privacy-Preserving Federated LLM Fine-Tuning"

この記事をシェア
X はてブ LinkedIn