研究論文投稿サイトのarXiv (アーカイヴ)が2026年10月8日(現地時間)に公開した論文「When Routing Reveals Membership: Privacy Leakage from MoE Router Telemetry」は、Mixture-of-Experts (MoE)言語モデルが推論時に生成するルーティング情報が、モデルのファインチューニングに使用されたデータのプライバシー漏洩を引き起こす可能性を指摘した。本研究では、ルーティング情報を用いた新たなメンバーシップ推論攻撃の手法が提示されている。
本論文の著者らは、Mixture-of-Experts (MoE)言語モデルの内部計算を示すルーティングテレメトリーが、モデルのファインチューニングに特定データが使用されたかどうかを明らかにする可能性があるというプライバシー問題に焦点を当てた。Yixin Tan氏ら著者陣が導入したルーティング強化型メンバーシップ推論攻撃は、従来の出力側シグナルと集約されたルーティング機能を組み合わせ、独立してファインチューニングされたシャドウモデルから学習したメンバーシップ分類器をターゲットモデルに適用する。
実験は3つのMoEアーキテクチャと3つのデータドメインにわたって実施され、ルーティングテレメトリーは、出力シグナルアンサンブルを用いた場合と比較して、メンバーシップ推論の性能を一貫して向上させた。1%の偽陽性率(FPR)における真陽性率(TPR)は、全9設定で2.7~9.4パーセンテージポイント増加したという。
このプライバシー漏洩は、フルファインチューニング、フリーズドルーター学習、LoRA、インストラクションチューニングといった様々な学習手法で持続的に観測される。さらに、離散的なエキスパート選択、制限されたテレメトリー、または単一のシャドウモデルといった条件でも、漏洩は確認された。
メカニズム分析では、この漏洩がルーティング固有の記憶化を必要としないことが示された。ファインチューニングによってメンバーシップ情報が隠れた表現に導入され、ルーティングはパラメータがフリーズされている場合でも、このシグナルのプロジェクションを露出させると説明されている。テレメトリーを摂動させることで、その忠実度が低下するにつれてこの追加の漏洩は減少する。本研究の結果は、ルーティングテレメトリーがファインチューニングされたMoEモデルにとって、運用シグナルから追加のプライバシー漏洩面になり得ることを示している。
参考: arXiv cs.LG — 2026年10月9日 13:00 (JST)
原文ハイライト"router telemetry consistently improves membership inference over a strong output-signal ensemble"