arXiv cs.LGは7月17日(現地時間)、Mixture-of-Experts (MoE) 大規模言語モデル (LLM) の推論効率を大幅に改善する新手法「PagedWeight」を発表した。同技術は、MoE LLM運用における主要課題である、増大するモデルウェイトとKey-Value (KV) キャッシュのGPUメモリ要件に対し、ランタイムでの動的かつ品質を意識したウェイト量子化で対処する。これにより、エキスパートウェイトの精度を維持しつつKVキャッシュサイズを最適化し、全体的なリソース効率を大幅に改善。特に、既存手法と比較してGPUメモリを最大72.0%削減し、スループットを最大1.94倍向上させることが可能と報告されている。
Mixture-of-Experts (MoE) 大規模言語モデル (LLM) は、その膨大なパラメータ数によって高い性能を発揮する一方で、モデルウェイトとKey-Value (KV) キャッシュの増大がGPUメモリ要件を大幅に引き上げ、効率的な推論サービス提供のボトルネックとなっていた。特に、高精度が要求される場面では、モデルウェイトの量子化適用が困難であり、これがメモリ消費抑制の大きな障壁となっていた。
「PagedWeight」は、この課題に対し、ランタイムでの動的かつ品質を意識したウェイト量子化という新しい管理手法を導入する。これにより、モデルのタスク精度、メモリ消費、スループット、レイテンシーといった複数の性能指標間でのトレードオフを効果的に調整することが可能である。従来の静的量子化手法にはない柔軟性により、利用可能なGPUメモリの制約下で、推論品質を最大限に維持しつつ効率性を高めることを目指す。
具体的には、PagedWeightは、推論プロセス中にGPUメモリの使用状況をリアルタイムで監視し、それに合わせてエキスパートウェイトの量子化ビット幅を動的に調整する。これにより、メモリが逼迫した状況では量子化レベルを強め、余裕がある場合は精度を優先するといった最適化が可能になる。また、GPUメモリのページングメカニズムを活用することで、MoEモデルのスパースな活性化パターンに合わせたメモリ割り当てを実現し、メモリフットプリントをさらに削減する。
複数のメモリセンシティブなMoEサービスシナリオにおける評価では、PagedWeightが既存の量子化ベースラインと比較して、品質とメモリのトレードオフを大幅に改善することが示されている。ベンチマーク結果によれば、FP16(半精度浮動小数点)と同等の精度を維持しつつ、GPUメモリを最大72.0%削減し、スループットを最大1.94倍向上させることが可能と報告されている。このメモリ削減とスループット向上は、特に大規模なMoEモデルを限られたハードウェアリソースで運用する際に極めて重要となる。
さらに、同程度のメモリ予算が与えられた場合、PagedWeightは他の量子化手法と比較して推論品質を最大39.3%改善し、同時にスループットの低下を最大4.1%に抑えるとしている。これは、メモリ効率と推論品質、スループットの間の複雑なバランスを極めて高いレベルで実現していることを示唆する。この技術は、大規模なMoEモデルの商用展開や、より広範な研究開発において、パフォーマンスとコスト効率の改善に大きく貢献すると見られる。
この研究は、Yuchen Yang氏、Yifan Zhao氏、Anisha Dasgupta氏、Sasa Misailovic氏によって共同で執筆された。
参考: arXiv cs.LG — 2026年7月18日 02:58 (JST)
原文ハイライト"dynamic quality-aware weight quantization"