Flash-dLLM、拡散型LLMのKVキャッシュI/O問題解消し推論最大11倍高速化
Quan Nguyen-Tri氏ら研究者は9月22日(現地時間)、拡散型大規模言語モデル(dLLM)の推論を高速化する新フレームワーク「Flash-dLLM」の論文をarXiv cs.CLに投稿した。トレーニング不要の手法で、KVキャッシュの再利用と並列トークン検証を同時適用する際に生じるGPUメモリI/Oのボトルネックを解消したとする。既存の最先端手法と比較し、最大11倍の速度向上を確認したとしている。
Tag
1 件の関連記事