Ai2 (Allen Institute for AI) は2026年10月9日(現地時間)、GPUクラスター向けスケジューリングシステムを刷新したと発表した。この新しいシステムは、GPU時間予算、階層的フェアシェア割り当て、タイムスライシング契約を含み、高影響度の研究を優先しつつ、GPUの完全な占有率を維持することを目指す。これにより、GPU時間の割り当てに関する議論は透明な予算プロセスへと移行した。

Ai2は、数千台のNVIDIA H100、B200、B300 GPUで構成される大規模なクラスターを運用しており、約150人の内部研究者にLLMやVLMのトレーニング、ロボット工学の強化学習(RL)シミュレーションなどのGPU計算能力を提供している。以前は優先度ベースのスケジューラを使用していたが、GPUの「squatting」(ユーザーが使っていないGPUを確保する行為)や、全てのワークロードが高優先度を使用する「優先度インフレ」といった問題に直面していた。これにより、下位優先度のワークロードはGPU時間を全く得られない状況が生じていた。

これらの問題は、共有資源を巡る「共有地の悲劇」として認識され、Ai2は共有資源を「私有化」する解決策を模索した。具体的には、チームにGPUそのものを割り当てるのではなく、GPU時間の一部を割り当てる予算モデルを採用した。このモデルでは、マネージャーが研究の潜在的な影響に基づいて、各研究プロジェクトにGPU時間を事前に割り当てる。これにより、ワークロードの優先順位付けが、到着時に個別の議論ではなく、戦略的な予算編成プロセスに基づいて行われるようになった。

新しいシステムでは、全てのGPU時間要求は予算によって支えられ、予算を持たない要求はプリエンプション(割り込み)から保護されない。これにより、GPUを不正に利用しようとする行為は、そのチームの予算を消費することになり、予算獲得に向けた議論に正直に参加するインセンティブが生まれる。この予算レビュープロセスは継続的に改善されており、研究者が自身の必要な時間を主張する機会が頻繁に提供され、トレードオフを最もよく理解しているマネージャーによって決定が下される。

このGPU時間予算ツールと連携して、Ai2は階層的フェアシェアスケジューラを構築した。このアルゴリズムは、Hadoop Fair Scheduler(2009年)にまで遡るもので、SLURMのFair TreeやYARNのFair Schedulerなどでも同様のアプローチが現在も活用されている。


参考: Hugging Face Blog (アーカイブ) — 2026年10月10日 00:20 (JST)

原文ハイライト

"Building a cluster scheduler to prioritize high-impact research while maintaining full occupancy"

この記事をシェア
X はてブ LinkedIn