Together AI、推論サービスSLA定義を詳説
Together AI(トゥゲザーAI)は2026年7月16日(現地時間)、同社ブログで、機械学習推論サービスにおける稼働時間保証(SLA)の信頼性指標、特に「99.9%アップタイム」の具体的な要件と、それを実現するためのアーキテクチャについて詳細を解説しました。同社は、ノードレベルからリージョンレベルまでの幅広い障害に対するサービス継続性について言及しています。
Tag
4 件の関連記事
Together AI(トゥゲザーAI)は2026年7月16日(現地時間)、同社ブログで、機械学習推論サービスにおける稼働時間保証(SLA)の信頼性指標、特に「99.9%アップタイム」の具体的な要件と、それを実現するためのアーキテクチャについて詳細を解説しました。同社は、ノードレベルからリージョンレベルまでの幅広い障害に対するサービス継続性について言及しています。
エヌビディア (NVIDIA) は6月30日(現地時間)、同社の推論ソフトウェアスタックにより、AIインフラにおけるトークンコストを大幅に削減したと発表した。特に、NVIDIAのBlackwellプラットフォーム上でDeepSeek V4モデルのトークンあたりのコストが、約1ヶ月で最大5分の1に削減されたことを明らかにした。AIプロジェクトが本番環境へ移行する中で、インフラ意思決定の焦点がチップのピーク性能からトークンあたりのコストへと変化していると指摘されている。
Together AIは2026年6月1日(現地時間)、MiniMaxの最新モデルM3について、同社がプリファードクラウドパートナーとして効率的な推論を実現したと発表した。同社の推論およびカーネルチームは、KV-Block-Major sparse attention kernelなどの主要な最適化により、異なる同時実行レベルで81%から125%のスループット向上を達成した。MiniMax M3はオープンウェイトモデルとして公開後、Together AIが開発者向けエンドポイントとしてホストする。
AIチップメーカーのCerebras Systemsは2026年5月11日(現地時間)、新規株式公開 (IPO) における発行株数と価格を引き上げる見込みだと報じられた。AI向け半導体需要が急増するなか、同社株への強い需要が背景にある。AIの演算処理はこれまでグラフィックス処理ユニット (GPU) が中心だったが、将来的には訓練から推論まで、より多様なハードウェア構成が求められるとの見方が示されている。