arXiv cs.LGが2026年10月7日(現地時間)付けで、グラフニューラルネットワーク (GNNs) から多層パーセプトロン (MLPs) への知識蒸留における課題に関する研究論文を発表した。この論文「Distilling Graph Geometry: Knowledge Gap from GNNs to MLPs」では、既存手法が教師モデルの持つグラフ由来の幾何学的情報を適切に保持できていない点を指摘。この問題を解決するため、Ollivier-Ricci曲率に誘導される新しい学習時蒸留フレームワーク「Graph Geometry-aware MLP (G^2MLP)」を提案した。
GNNからMLPへの知識蒸留は、メッセージパッシングを行う教師モデルの予測精度を維持しつつ、推論時にグラフアクセスを必要としないMLPモデルを展開することを目的とする。しかし、既存の蒸留手法は主にノードごとの予測転送や信頼度に基づく重み付けを用いており、生徒モデルが教師モデルのグラフ誘起幾何学的情報をどこで保持すべきかを明確に指定していなかった。
この欠落は、生徒モデルの表現空間において二つの「スペクトル失敗モード」を引き起こすことが示されている。疎なグラフにおいては「スペクトル過少適合」が発生し、生徒モデルは境界領域に集中する高エネルギーの教師方向を見落とす。一方、密なグラフでは「スペクトル過剰適合」が発生し、教師モデルがアグリゲーションによって崩壊させた偽の方向を保持してしまう。
著者らは、これらの問題を克服するため、エネルギー加重教師-生徒アラインメント目的関数に基づき、Ollivier-Ricci曲率に誘導される学習時蒸留フレームワークGraph Geometry-aware MLP (G^2MLP)を提案した。この曲率を用いることで、二つのスペクトル誤差が集中する箇所を特定し、予測レベルと表現レベルのアラインメント間で監視を適切に割り当てることが可能になる。展開されるG^2MLPモデルは標準的なMLPであり、推論時にグラフへのアクセスは不要となる。
ノード分類ベンチマーク全体で、G^2MLPはグラフフリー蒸留のベースラインよりも継続的に性能を向上させた。また、疎密両方のグラフ状況で教師-生徒間のランクギャップを削減し、アーキテクチャの変更なしにGraph Transformer教師モデルやリンク予測タスクへの転送も可能であることを示した。
参考: arXiv cs.LG (アーカイブ) — 2026年10月8日 02:56 (JST)
原文ハイライト"Existing methods mainly transfer node-wise predictions or use confidence-based reweighting, but they do not specify"