Nenad Banfic氏らの研究チームは9月18日(現地時間)、低ビットのキーバリュー(KV)キャッシュ量子化におけるビジョン言語モデル(VLM)の精度低下を抑制する新手法「HeadGuard(ヘッドガード)」を発表した。同手法は、既存のKVキャッシュ量子化器に選択的な高精度マスクを組み合わせることで、ストレージ削減と高精度維持の両立を目指す。これにより、AIモデルの効率性と性能向上に貢献する。

HeadGuardは、低ビットKVキャッシュ量子化がVLMの精度を大幅に低下させる課題に対処するために開発された。本手法は、ベースとなるKVキャッシュ量子化器に固定された高精度マスクを補完的に適用する「ヘッド保護」のメカニズムを採用している。

具体的には、イメージ感度スコアと出力感度スコアを用いて、物理的なKVヘッドをオフラインで選択する。主要な実験では、約8分の1のヘッドが保護対象として選定された。保護対象となったイメージキー、およびオプションとしてバリューはbfloat16 (BF16) の精度を維持する一方、保護されていないイメージエントリはベース量子化器によって量子化される。

評価は、8種類のVLM、3種類のベース量子化器、そして6つの識別タスクと2つの生成タスクを含む8つのベンチマークを用いて実施された。HeadGuardは、精度の低い量子化器において失われた精度の大部分を回復させることが確認されており、特にQwenとInternVLで顕著な改善が見られた。

2ビット量子化の場合、8モデル全体における6タスク識別平均スコアは、最も性能の低いベース量子化器で0.436から0.580へ向上した。この保護メカニズムは、生成される回答の質やキャプションの忠実度もBF16出力に近づけることが確認されている。精度向上効果は、テストされた3種類の量子化器すべてと、2種類のキャリブレーションデータセットの両方で持続した。さらに、キーのみを保護する方式でも、ストレージコストを抑えつつ実質的な回復効果が得られた。HeadGuardは、基盤となる量子化器を置き換えることなく、低ビットVLMの精度を改善する構成可能な方法を提供する。


参考: arXiv cs.LG (アーカイブ) — 2026年9月30日 13:00 (JST)

この記事をシェア
X はてブ LinkedIn