リサーチ・論文

Windowed-MTP、投機的デコーディングの性能を向上

arXiv cs.LGは2026年7月23日(現地時間)付けで、機械学習分野の論文「Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context」を公開した。この論文は、大規模言語モデルの自動回帰生成を加速する投機的デコーディングにおいて、既存のMulti-Token-Prediction (MTP) ドラフトヘッドが抱えるフルコンテキストでの計算コスト問題を解決する新手法「Windowed-MTP」を提案している。これにより、million-tokenコンテキストでのデコードステップあたりのコストを最大44%削減したと報告された。

ベンダー・製品

NVIDIA、Nemotron-Labs Diffusionを発表 高速テキスト生成と並列処理を実現

NVIDIAは2026年5月23日(現地時間)、拡散言語モデル(DLM)を基盤とする新たなテキスト生成モデル「ネモトロン・ラボ・ディフュージョン(Nemotron-Labs Diffusion)」を発表した。従来の自己回帰型(AR)モデルとは異なり、このモデルは複数のトークンを並列で生成し、反復的に改善する方式を採用する。これにより、現代のGPUにおける計算モデルを効率的に活用し、ランタイム性能の大幅な向上と、既存テキストの修正能力を提供するとしている。