arXivは10月1日(現地時間)、研究論文「Hierarchical Continuous Diffusion Language Models (HC-DLM)」を公開した。本研究は、既存の離散拡散言語モデルと連続拡散言語モデルが抱える構造的ボトルネックを解決するため、離散トークン生成と連続潜在軌道を単一のノイズ除去プロセスで統合するHC-DLMを提案。この新モデルは、言語モデリングにおける表現能力と生成の一貫性を向上させる可能性を示している。
従来のDiscrete diffusion language modelsは、並行デコード時に各トークンが独立してサンプリングされるため、トークン間の統計的依存関係が分断されるという構造的ボトルネックを抱えていた。一方、Continuous diffusion language modelsはこの問題を共有される連続状態のノイズ除去によって回避するものの、デノイザーがその状態のみを認識するため、最終的なデコードにおける有効なトークン構成との関連付けが困難であった。
フイ・レン (Hui Ren)氏、ズーハン・リー (Zihan Li)氏、チャン・リュウ (Chang Liu)氏、フイドン・リュウ (Huidong Liu)氏、アレクサンダー・シュヴィング (Alexander Schwing)氏ら研究チームは、これらの課題に対処するため、HC-DLMを開発した。HC-DLMは、潜在状態を唯一の持続的な生成状態として維持し、各ステップでトークンがそこから読み出され、次の潜在更新の足場としてフィードバックされる独自の機構を持つ。その訓練目的は、トークン尤度の変分下限から導出されるように設計されている。
構造化推論タスクのSudoku、数学的計画タスクのCountdown、および大規模言語モデリングタスクのLM1Bにおいて、HC-DLMは同規模のDiscrete diffusion language modelsおよびContinuous diffusion language modelsのベースラインを上回る性能を示した。具体的には、SudokuとCountdownではパズルの正答率が、LM1Bでは生成パープレキシティがそれぞれ改善されている。
参考: arXiv cs.CL (アーカイブ) — 2026年10月2日 02:59 (JST)