ムナワル・ハサン氏とアポストル・ヴァシレフ氏は2026年8月31日(現地時間)、arXiv cs.LGに「Curvature Cryptanalysis of Smooth Transformer Feed-Forward Networks」と題する論文を発表した。この研究は、滑らかな2層フィードフォワードネットワーク(FFNs)が、特定の条件下で追加の構造モデル抽出チャネルを露出させることを示した。パラメータや勾配へのアクセスなしに、選ばれた入力と生の出力情報のみを用いることで、隠れた内部構造を高精度で回復する手法が詳述されている。
この研究は、GELUまたはSiLU活性化関数を持つTransformer FFNブランチを対象とし、選ばれた入力と生の出力へのアクセスのみを用いる。パラメータ、勾配、内部活性化にはアクセスしない。研究者らは、射影された入力ヘシアン(projected input Hessians)が、FFN入力重みによって誘発される隠れた対称ランク1因子(symmetric rank-one factors)の異なる混合を形成する二次漏洩チャネル(second-order leakage channel)を利用する。
ヘシアン収集は部分対称分解(partially symmetric decomposition)として形式化され、局所的識別可能性(local identifiability)と安定性の条件が確立された。また、ベクトル出力ステンシル再利用(vector-output stencil reuse)を活用することで、構造クエリコストを16分の1に削減している。
独立して訓練されたCIFAR-10画像認識Transformerに対する実験では、わずか16の射影ヘシアン(8193回のブラックボックスクエリに相当)を用いて、隠れたFFNの方向を平均絶対コサインアライメント0.94以上で回復した。GELUの95.1%、SiLUの91.9%の方向で0.90のアライメントを超過した。回復精度は、独立して訓練されたモデル、繰り返しの抽出実行、および全てのTransformerブロックで高い水準を維持している。
回復された構造は機能抽出(functional extraction)もサポートしており、回復された方向を固定し、残りのFFNパラメータのみをフィッティングすることで、93%以上のトップ1一致度を持つ高忠実度代替モデルが生成された。テスト精度はGELUおよびSiLUターゲットと比較して0.90%および0.62%以内に収まった。出力の丸めやガウスノイズは、初期設定では回復を減少させるが、有限差分ステップ(finite-difference step)を適応させることで平均アライメントは0.9603と0.9398に回復した。これは、ブラックボックスの二次観測から隠れたFFN構造の回復、そして機能的代替に至る一連の経路を示すものとされる。特定のオラクルモデルの下では、滑らかなFFNの曲率が、振る舞い忠実性のみでは明らかにできない内部パラメータの幾何学を露出させることが示唆されている。
参考: arXiv cs.LG (アーカイブ) — 2026年9月1日 13:00 (JST)
原文ハイライト"smooth FFN curvature exposes internal parameter geometry that behavioral fidelity alone cannot reveal."