Hugging Face Blogは2026年10月1日(現地時間)付けで、大規模Mixture-of-Experts (MoE) モデルのトレーニング向けに再設計されたオープンな基盤「Olmo-core 3」のリリースを報じた。Olmo-core 3は、MoEトレーニングを数兆パラメータ規模まで拡張しつつ、計算効率を維持するように設計されている。これはOlmoの次世代を支える中核システムの一つであり、新たなモデル開発におけるツールとトレーニングインフラをオープンにする取り組みの一環として位置づけられる。

大規模なAIモデルのトレーニングには多大な計算資源が必要で、コストとエネルギー消費が増加し、多くの研究者や小規模ラボにとって高度なモデル開発が困難になっている。MoEモデルは、より効率的なアプローチを提供し、各入力がすべてのコンポーネントを使用することなく、より多くの学習コンポーネント(パラメータ)を含めることができる。

しかし、フルモデルをGPUメモリに保存し、トレーニング中に更新する必要があり、クラスタ全体で入力を適切なエキスパート(MoE内の専門コンポーネント)にルーティングする際には、通信と調整のコストが発生する。MoEが大規模化するにつれて、これらのコストは、各入力にモデルの一部のみを使用することによる計算上の利点を損なう可能性がある。Olmo-core 3はこのギャップを埋めることを目指して構築された。

ベンチマークでは、トークンあたりのアクティブなパラメータ数を約3.2Bに固定したまま、エキスパートプールを8から128に増加させ、トークンあたり4つのエキスパートのみを選択した。これにより、総パラメータ容量は4.6Bから47Bに増加したが、トレーニングスループットの低下は5%未満だった。同じインフラは1兆以上の総パラメータでもベンチマークされている。

Olmo-core 3は、複数の技術と最適化を組み合わせて、大規模MoEをGPUクラスタ全体に分散させ、ルーティングと計算の効率を向上させる。モデルとそのトレーニング状態をハードウェアに分割する3つの主要技術は、エキスパート並列処理、パイプライン並列処理、分散オプティマイザである。これらの技術により、すべてのGPUがモデル全体とトレーニング状態をメモリに保持することなく、MoEをスケールさせることが可能になる。

また、Olmo-core 3は、データが適切なエキスパートにルーティングされるコストと、その計算を実行するコストを削減する。行ごとのエキスパート並列処理、GPU常駐型ルーティング、グループ化されたGEMMなどが採用されている。さらに、MXFP8と呼ばれる低精度数値フォーマットをサポートし、計算量とGPU間のデータ移動量を削減できる。

4つのNVIDIA B300 GPUを用いた制御ベンチマークでは、MXFP8を最も効果的なシステム部分で有効にした場合、トレーニングスループットはベースラインとして使用された高精度フォーマットBF16と比較して約21%向上し、ピークアクティブメモリは103 GiBから95 GiBに減少した。Hugging Face Blogは、Olmo-core 3が次世代のOlmoの基盤であり、MoEアーキテクチャを採用する次期Olmoは、これまでで最も高性能なOlmoになることを目指していると伝えている。


参考: Hugging Face Blog (アーカイブ) — 2026年10月2日 00:01 (JST)

原文ハイライト

"Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs"

この記事をシェア
X はてブ LinkedIn