リサーチ・論文

LLM推論効率化の新手法「FAMPWQ」登場、適応型量子化で性能向上

論文投稿サイトarXiv cs.LGは8月26日(現地時間)、大規模言語モデル(LLM)の推論効率を大幅に向上させる新たな量子化手法「FAMPWQ (Fisher Information-based Adaptive Mixed Precision Weight Quantization)」に関する研究論文を発表した。本手法は、Fisher情報を用いて各層の量子化感度を測定し、強化学習ベースのビット幅アロケータで最適な重み量子化を適応的に適用することで、汎用GPU環境下でのLLM推論の効率化と性能維持を目指す。

ベンダー・製品

NVIDIAとアイレン、AIインフラで戦略提携 最大5ギガワット規模展開へ

NVIDIAは5月7日(現地時間)、アイレン (IREN) と次世代AIインフラの展開を加速するための戦略的提携を発表した。この協業により、アイレンの持つグローバルデータセンターパイプライン全体で、最大5ギガワットに及ぶエヌビディア DSX (NVIDIA DSX) 対応のAIインフラを展開する計画だ。AIネイティブやスタートアップ、エンタープライズ顧客へのアクセス拡大を目指す。

ベンダー・製品

AMD、AI推論市場向けソリューション強化でタアラス買収を発表

AMDは2026年8月5日(現地時間)、AI推論シリコン開発を手がけるタアラス (Taalas) を買収する最終合意に達したと発表した。本買収は、AI推論市場の急速な成長とワークロードの専門化に対応するため、タアラスの差別化された推論技術とエンジニアリング専門知識をAMDの長期的なAIロードマップへ統合することを目的としている。タアラスの技術は、汎用アーキテクチャで生じるコンピューティングとメモリのボトルネックを削減し、推論データフローを最適化する。

ベンダー・製品

Together AIとY Combinator、YCコミュニティ専用GPUクラスターを稼働

Together AIとY Combinator (YC) は2026年7月20日(現地時間)、YCのAIネイティブスタートアップ向けに初の専用GPUクラスターを共同で立ち上げたと発表した。この戦略的提携は、AIアプリケーション開発に不可欠な高性能コンピューティングリソースへのアクセスを大幅に改善することを目的としている。スタートアップは高額な先行投資や長期契約に縛られることなく、必要に応じてGPUを柔軟に利用できる環境を手に入れる。クラスターは既に稼働を開始しており、短期間での柔軟なGPU利用を通じて、AI開発サイクルの加速に貢献する。

リサーチ・論文

PagedWeight、MoE LLM推論のGPUメモリを最大72.0%削減

arXiv cs.LGは7月17日(現地時間)、Mixture-of-Experts (MoE) 大規模言語モデル (LLM) の推論効率を大幅に改善する新手法「PagedWeight」を発表した。同技術は、MoE LLM運用における主要課題である、増大するモデルウェイトとKey-Value (KV) キャッシュのGPUメモリ要件に対し、ランタイムでの動的かつ品質を意識したウェイト量子化で対処する。これにより、エキスパートウェイトの精度を維持しつつKVキャッシュサイズを最適化し、全体的なリソース効率を大幅に改善。特に、既存手法と比較してGPUメモリを最大72.0%削減し、スループットを最大1.94倍向上させることが可能と報告されている。

ベンダー・製品

Hugging Face、Amazon SageMaker Studioとワンクリック連携

Hugging Face (ハギングフェイス) は7月7日(現地時間)、Amazon SageMaker Studio (アマゾン セージメーカー スタジオ) とのディープリンク連携を発表した。この統合により、開発者はHugging FaceのモデルページからワンクリックでAmazon SageMaker Studioに直接アクセスし、モデルのファインチューニングやデプロイを即座に開始できるようになる。発見からエンタープライズデプロイまでのプロセスを効率化するのが狙いだ。

ベンダー・製品

【速報】Microsoft、Foundry上でHugging Faceモデルを提供開始

Microsoftは2026年7月7日(現地時間)、年次開発者会議Microsoft Build 2026において、Foundry Managed Compute上でHugging Faceモデルの提供を開始すると発表した。これにより、Hugging Faceエコシステムから厳選されたオープンウェイトモデルのカタログが、Foundry Managed Computeからワンクリックでデプロイ可能になる。モデルのウェイトはAzureにプリステージされ、ランタイムはMicrosoftが構築・スキャンする。

ベンダー・製品

Together AI、GPUクラスターの自動ノード修復を提供

Together AIは2026年6月24日(現地時間)、GPUクラスター向けにパッシブヘルスチェックと自動ノード修復機能の提供を開始した。この新機能により、ノードレベルの問題が検出された際にシステムが修復推奨を生成し、ユーザーが承認することで、ノードの隔離、ドレイン、修復、再結合プロセスを自動で処理する。また、同日にはファインチューニングジョブの推定コストをAPI経由で取得できる新エンドポイント「POST /fine-tunes/estimate-price」も追加された。

ベンダー・製品

Hugging Face Blog、PyTorchプロファイリングガイド新シリーズを開始

Hugging Face Blogが2026年5月24日(現地時間)付けで報じたところによると、PyTorchのプロファイリングツール「torch.profiler」に関する新シリーズ「Profiling in PyTorch」の第一弾記事を公開しました。本シリーズは、複雑なプロファイラートレースの読み方を段階的に習得し、モデルの最適化に役立てることを目的としています。初回の記事では、最も基本的な行列乗算とバイアス加算の操作を例に、プロファイラーの出力解読法を解説しています。

リサーチ・論文

文書AI運用化へマイクロサービス提案 OCRとLLM連携パイプライン最適化

arXiv cs.AIは2026年5月12日(UTC)付けで、文書AI(Document AI)システムを本番環境で運用化するためのマイクロサービスアーキテクチャに関する研究論文を発表した。同論文は、文書の分類、光学文字認識(OCR)、大規模言語モデル(LLM)を用いた構造化フィールド抽出など、複数のモデルパイプラインをカプセル化する設計を詳述している。これは、学術研究で生まれた先進技術と、実稼働環境での効率的かつ堅牢な実装との間のギャップを埋めることを主目的としている。

ベンダー・製品

Hugging FaceがLLM推論効率化の新手法発表 非同期バッチ処理でCPU・GPUを並列化

Hugging Faceは2026年5月14日(現地時間)、大規模言語モデル (LLM) の推論効率を大幅に高める非同期バッチ処理の技術詳細を公開した。従来の同期処理ではCPUとGPUが交互に動作するため、GPUがアイドル状態となる時間が推論実行時間の約24%を占め、これが大きな課題と指摘されてきた。今回の新手法は、このアイドル時間を解消し、GPUの稼働率を最大化することで、推論時間の短縮とリソース利用効率の向上を目指す。

VC・資金調達

Cerebras、AI推論用チップ需要高まりでIPO価格・規模引き上げへ

AIチップメーカーのCerebras Systemsは2026年5月11日(現地時間)、新規株式公開 (IPO) における発行株数と価格を引き上げる見込みだと報じられた。AI向け半導体需要が急増するなか、同社株への強い需要が背景にある。AIの演算処理はこれまでグラフィックス処理ユニット (GPU) が中心だったが、将来的には訓練から推論まで、より多様なハードウェア構成が求められるとの見方が示されている。