FluidPDは2026年10月1日(現地時間)、大規模言語モデル (LLM) サービスにおけるプレフィル・デコード分離アーキテクチャ向けの新しいシステムを発表した。このシステムは、LLMワークロードの需要比率変動に起因するサービスレベル目標 (SLO) 違反を回避するため、インプレースでの弾力性を提供する。既存のオートスケーリングメカニズムが持つ課題を解決し、追加のワーカーを必要とせずにサービス品質の改善を目指す。

arXiv cs.AIが2026年10月1日(現地時間)に公開した論文によると、FluidPDは、LLM推論におけるプレフィルとデコードのフェーズが持つ異なる実行パターンとSLO目標に対応するために開発された。既存のシステムは通常、固定されたプレフィル/デコードワーカー比率とワーカー間のリクエストルーティングを組み合わせる。しかし、実際のワークロードではプレフィルからデコードへの需要比率に短期的な急増と持続的な変化が見られるため、適切な構成でも不一致が生じ、アイドル状態の容量が存在してもレイテンシSLO違反が発生する可能性があった。

FluidPDは二つの補完的なメカニズムを導入している。一つは「FluidToken」で、デコードワーカー側に余裕がある場合にプレフィル計算の一部をオフロードすることで一時的な不均衡に対応する。もう一つは「FluidRole」で、実行中のワーカーをプレフィルとデコードの役割間でインプレースで再割り当てする。これにより、モデルの再ロードやエンジンの再起動を回避し、持続的な不均衡に対処する。これらのメカニズムは、SLO違反が顕在化する前にプレフィルとデコード側のリソース圧力を示す軽量な圧力インデックスによってガイドされる。

Azureのプロダクショントレースワークロードを用いた評価において、FluidPDは静的なSGLangと比較して、全体のSLO達成率を最大94.6 percentage points向上させた。この結果は、追加のワーカーをプロビジョニングすることなく、SLOを考慮したインプレースでのプレフィル・デコード弾力性がサービス品質を改善することを示している。


参考: arXiv cs.AI (アーカイブ) — 2026年10月7日 13:00 (JST)

原文ハイライト

"In-Place Elasticity for SLO-Aware Prefill-Decode Disaggregated LLM Serving"

この記事をシェア
X はてブ LinkedIn