arXiv cs.CLは2026年9月29日(現地時間)、ビンチェン・ヤオ氏らが線形アテンションの再帰状態における量子化エラーを効率的に管理する新フレームワーク「STEPQuant」に関する論文を発表した。本研究は、肥大化するKVキャッシュに伴う並行サービス提供時のメモリボトルネックを軽減しつつ、モデルの推論精度を維持することを目指すもので、その実用性が注目される。
線形アテンションは、大規模なKVキャッシュを固定サイズの再帰状態に置き換える技術だが、これらの持続的な状態は並行サービス提供下で大きなメモリボトルネックとなることが指摘されてきた。従来、再帰状態を低精度に直接量子化すると、量子化エラーが連続的な状態更新を通じて伝播し、モデルの精度が著しく低下するという課題があった。
研究チームは、これらの量子化エラーがモデル出力に与える影響が、時間的および空間的な二つの補完的な次元に依存することを明らかにした。時間的な側面では、長期間存続するメモリ内のエラーは、多数のデコーディングステップにわたって持続するという。空間的な側面では、異なるキー行におけるエラーはモデル出力に異なる影響を与え、また状態の大きさは行と列の両方で大きく変動することが判明した。
これらの観察に基づき提案されたのが、Delta-rule再帰状態向けの空間的・時間的ポストトレーニング量子化フレームワークであるSTEPQuantである。STEPQuantは、エラーの大きさとメモリの寿命に応じて精度を割り当て、状態分布およびキー行が出力エラーに与える影響に基づいてキー行と値列のスケールを共同で適合させる。
実験では、Qwen3.8-27BおよびKimi-Linear-48B-A3B-Instructモデルを用いて、長短両方の生成ベンチマークでSTEPQuantの性能を評価した。その結果、STEPQuantは名目上の6-bit予算においてFP32状態の精度に密接に一致する性能を示し、4-bit設定ではuniform INT8を上回った。さらに、最適化されたGPUカーネルを持つSGLangに統合された6-bit STEPQuantは、再帰状態の5倍以上の圧縮を達成し、総サービスメモリを最大68.7%削減した。関連コードはこのhttps URLで公開されている。
参考: arXiv cs.CL — 2026年9月30日 02:59 (JST)