Quan Nguyen-Tri氏ら研究者は9月22日(現地時間)、拡散型大規模言語モデル(dLLM)の推論を高速化する新フレームワーク「Flash-dLLM」の論文をarXiv cs.CLに投稿した。トレーニング不要の手法で、KVキャッシュの再利用と並列トークン検証を同時適用する際に生じるGPUメモリI/Oのボトルネックを解消したとする。既存の最先端手法と比較し、最大11倍の速度向上を確認したとしている。

論文の著者はQuan Nguyen-Tri氏、Mukul Ranjan氏、Zhiqiang Shen氏ら。dLLMはテキストを一括で生成する非自己回帰型の生成方式を採る言語モデルで、自己回帰型モデルに比べ理論上は並列生成による高速化が見込まれる一方、実装面での効率化が課題とされてきた。

従来の加速手法は、KVキャッシュの再利用と並列トークンの検証をそれぞれ個別に最適化していた。両者を同時に適用するとGPUメモリのI/O(入出力)が新たなボトルネックとして生じ、速度向上が頭打ちになっていたという。Flash-dLLMはこの点を最初に特定し、冗長なメモリ移動を削減する「I/Oを意識した統合KVキャッシュカーネル」を導入した。

同フレームワークはさらに、最適化したKVキャッシュ機構を基盤に、効率的な「KVキャッシュ駆動型ドラフト・アンド・検証」デコーディング戦略を提案した。dLLM自体がドラフト生成と検証の両方を担う設計とすることで、補助モデルを別途用意する必要をなくした。生成品質を保ちながらデコーディングを高速化し、より長いシーケンスやより大きなバッチサイズへの対応力も高めたとしている。

検証実験には、数学的推論タスクのGSM8Kベンチマークと、コード生成タスクのHumanEvalベンチマークを用いた。既存の最先端手法である「Elastic-Cache」と比較したところ、Flash-dLLMはGSM8Kで5.1倍、HumanEvalで11.0倍の速度向上を記録した。推論速度とメモリ効率の両面で、比較対象とした既存のdLLM加速手法を一貫して上回ったという。

Flash-dLLMは追加の学習を必要としないトレーニング不要の手法であり、既存の拡散型言語モデルにそのまま適用できる点も特徴としている。論文はarXiv cs.CLに2026年9月22日17時59分57秒(協定世界時)付けで公開された。


参考: arXiv cs.CL — 2026年9月23日 02:59 (JST)

この記事をシェア
X はてブ LinkedIn