リサーチ・論文

MoEモデル量子化ダメージ、経路フリップの検出と修復課題を提示

パーヴェル・グー (Parvel Gu) は7月14日(現地時間)、arXiv cs.AIで論文を公開し、Mixture-of-Experts (MoE) ルーティングの不連続性が、4ビットKVキャッシュの量子化によって引き起こされる「フリップ」現象を明らかにした。このフリップはトークンを決定境界を越えさせ、エキスパートの活性化を反転させる。本研究は新たな緩和策を提案するものではなく、因果関係の解明、経験的発見、および検出限界に関する結果を提供している。

リサーチ・論文

QFedPolyp、ポリープセグメンテーション向け連合学習フレームワークを提案

マダン・バドゥワル (Madan Baduwal) 氏とプリヤンカ・ポウデル (Priyanka Paudel) 氏らは7月22日(現地時間)、ポリープセグメンテーションのための通信・推論効率の高い連合学習フレームワーク「QFedPolyp (キュフェドポリープ)」を提案した。このフレームワークは、機密性の高い医療データのプライバシーを保護しつつ、通信オーバーヘッドの削減と推論速度の向上を実現する。

リサーチ・論文

KVarN、KV-キャッシュ量子化で新SOTA樹立 推論タスク誤差を抑制

arxiv.orgは6月2日(現地時間)、Lorenz K. Muller氏らが発表した論文で、大規模言語モデル (LLM) の推論タスクにおけるKV-キャッシュ量子化の新手法「KVarN」が提示されたと報じた。このキャリブレーション不要の手法は、自己回帰デコーディング中の量子化誤差蓄積を抑制する。MATH500、AIME24、HumanEvalなどの生成ベンチマークでは、2ビット精度での新たなState-of-the-Art (SOTA) を確立した。