Yi Pan、Haocheng Xi、Kan Zhu、Xingyang Li、Yibo Wuら研究者グループは2026年9月29日(現地時間)、大規模言語モデル (LLM) の推論効率を大幅に向上させる新手法「LeapQuant」に関する論文をarXiv cs.LGで公開した。LeapQuantは、Gated DeltaNet (GDN) やKimi Delta Attention (KDA) など線形アテンションを採用するLLMにおいて、8ビット再帰状態量子化下でほぼ無損失の性能を達成する学習不要な手法である。

近年、標準的なアテンション機構を線形アテンションに置き換えるハイブリッド設計をLLMが採用する傾向が見られる。これらの設計は、文脈を固定サイズの再帰状態に圧縮し、長文脈処理のコストを大幅に削減するものの、この状態を繰り返し読み書き更新することが主要な推論ボトルネックとして残されていた。

量子化はこのコスト削減に有効な手段だが、量子化誤差の蓄積や状態内の外れ値の存在により、モデル品質が著しく劣化する可能性があった。LeapQuantはこれらの課題に対処するため、二つの主要な手法を提案する。一つ目は、誤差蓄積を軽減するper-window quantizationで、トークンのウィンドウを飛び越え、そのウィンドウの終わりに一度だけ状態を量子化する。ウィンドウ内では、固定された低ビット状態と高精度のバッファリングされた更新を利用して出力が計算される。

二つ目は、各量子化によって生じる誤差を削減する手法で、状態内の最大の外れ値を少数の高精度なCompensator Tokensとして保持する。これらのCompensator Tokensは実際のトークンと同様の更新パスを共有し、残りの残差は量子化前に平滑化され、誤差がさらに削減される。この手法は学習を必要としない。

Qwen、Kimi、GLMといったモデルファミリー全体にわたる広範な実験では、LeapQuantが推論時のメモリと計算コストを大幅に削減することが示された。NVIDIA B200、RTX PRO 6000、RTX 5090 GPUでの実験では、FP32ベースラインと同等の精度を保ちつつ、カーネルレベルで平均2.05〜3.70倍、エンドツーエンドの推論で1.47倍の高速化を達成した。


参考: arXiv cs.LG (アーカイブ) — 2026年9月30日 02:59 (JST)

この記事をシェア
X はてブ LinkedIn