Kiran Nair (キラン・ネアー) 氏、Smriti Regmi (スムリティ・レグミ) 氏、Rodrigue Rizk (ロドリグ・リスク) 氏らは7月28日(現地時間)、arXivで公開された論文の中で、トランスフォーマーの推論効率を向上させる新しいフレームワーク「CausalGate (コーザルゲート)」を開発したと発表した。CausalGateは、大規模言語モデル (LLM) における冗長なモジュールを特定し除去することで、計算効率を高めることを目的としている。
既存の適応型推論手法は、隠れ状態の類似性や活性化の強度といった観測的ヒューリスティックに依存しており、意味的精度に不可欠な微妙な非線形構造計算を捉えきれない場合があったと指摘されている。
CausalGateは、介入に基づいた手法であり、キャリブレーションフェーズ中に個々のAttention (アテンション) とMLP (多層パーセプトロン) サブレイヤーを分離する。それぞれの出力をゼロにすることで、最終的なロジット分布のカルバック・ライブラー・ダイバージェンス (Kullback-Leibler divergence) を介して正確な意味的ダメージを測定する。
ランタイムのルーティングオーバーヘッドを排除するため、この構造的重要性階層は、指数移動平均 (Exponential Moving Average) スムージング目的と微分可能なペアワイズランキング損失を組み合わせて、静的で軽量なスカラーゲートのグローバルセットに蒸留される。
TinyLlama-1.1B、Qwen2.5-3B、Llama-3.1-8Bなどのモデルで言語モデリングと常識推論のベンチマークにおいて評価された結果、CausalGateは既存の動的ルーティングおよびレイヤースキッピングのベースライン手法を一貫して上回った。これにより、理論的な計算量削減が具体的なハードウェアレイテンシーの削減に繋がり、運用上のオーバーヘッドは発生しないと報告されている。
参考: arXiv cs.LG (アーカイブ) — 2026年7月29日 13:00 (JST)
原文ハイライト"CausalGate: Causal Importance Distillation for Transformer Module Pruning"