Windowed-MTP、投機的デコーディングの性能を向上
arXiv cs.LGは2026年7月23日(現地時間)付けで、機械学習分野の論文「Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context」を公開した。この論文は、大規模言語モデルの自動回帰生成を加速する投機的デコーディングにおいて、既存のMulti-Token-Prediction (MTP) ドラフトヘッドが抱えるフルコンテキストでの計算コスト問題を解決する新手法「Windowed-MTP」を提案している。これにより、million-tokenコンテキストでのデコードステップあたりのコストを最大44%削減したと報告された。