OpenAI、初の独自推論チップ「Jalapeño」の性能を発表
OpenAIは2026年8月26日(現地時間)、同社初のカスタム推論チップ「Jalapeño」の性能測定結果を公開した。このチップは公開ベンチマーク「InferenceX」において、GPT‑OSS 120Bモデルを使用した場合、商用システムと比較してピークスループットとトークン遅延で優れた性能を示した。同社はデータセンターからモデル、製品に至るまで統合されたシステムでAI性能の向上を図る。
Tag
9 件の関連記事
OpenAIは2026年8月26日(現地時間)、同社初のカスタム推論チップ「Jalapeño」の性能測定結果を公開した。このチップは公開ベンチマーク「InferenceX」において、GPT‑OSS 120Bモデルを使用した場合、商用システムと比較してピークスループットとトークン遅延で優れた性能を示した。同社はデータセンターからモデル、製品に至るまで統合されたシステムでAI性能の向上を図る。
リキッドAI (LiquidAI) は2026年8月3日(現地時間)、オンデバイスエージェント向け言語モデル「LFM2.5-2.6B」を発表した。同モデルはノートパソコンからスマートフォンまで、一般的なハードウェア上でツール利用とマルチステップワークフローをサポートする。これにより、開発者はエージェントをあらゆる場所に展開し、データプライバシーをデバイス上で維持しながら、クラウド推論コストなしでの利用拡大を可能にする。
Xinyan Chen氏らの研究チームは7月9日(現地時間)、動画生成を通じて人工知能 (AI) の推論能力を向上させる新フレームワーク「オープンコフ (OpenCoF)」を発表した。OpenCoFは、推論特化型の動画データセット「OpenCoF-17K」と、このデータセットで訓練された動画モデル「Wan-CoF」で構成される。時系列に連結されたフレームから論理的帰結を導く「Chain-of-Frame (CoF) 推論」を実現し、AIのより高度な理解能力に貢献するという。
Together AIは7月8日(現地時間)、フロンティアオープンモデル向けの予約型推論容量サービス「プロビジョンド・スループット (Provisioned Throughput)」の提供を開始した。本サービスは、トークンベースの料金体系と99%の稼働時間サービス品質保証契約 (SLA) を提供し、企業が予測可能で信頼性の高い推論能力を利用できるよう設計されている。
リコンテキスト (ReContext) の研究チームは2026年7月2日(現地時間)、大規模言語モデル (LLM) の長文コンテキスト推論を改善する推論手法「RECONTEXT」を発表した。この手法は、モデル内部の関連性シグナルを活用し、クエリに応じた証拠プールを構築して最終生成前にリプレイすることで、トレーニング不要で効果的なコンテキスト利用を実現する。8つの長文データセットを用いた実験では、Qwen3-4B、Qwen3-8B、Llama3-8Bといったモデルにおいて、証拠利用の一貫した改善が確認された。
グロック (Groq) は2026年6月21日(現地時間)、AI推論クラウド事業の拡大を加速するため、新規に6億5000万ドルの成長資金を調達したと発表した。この資金調達ラウンドは、ディスラプティブ (Disruptive) とインフィニタム (Infinitum) が主導し、既存投資家も再投資に参加した。
arxiv.orgは6月11日(現地時間)、大規模言語モデル (LLM) の推論効率を高める新たなフレームワーク「ReSum」に関する論文を発表した。この研究は、既存の強化学習検証可能報酬 (Reinforcement Learning with Verifiable Rewards: RLVR) における推論の冗長性に着目。LLMが自身の推論軌跡を自己要約することで、推論の無駄を削減し、性能向上を実現したと報告している。実験では、平均4%の性能向上と18.6%の推論長さ削減を達成した。
arXiv cs.AIは2026年6月2日(現地時間)、「Visual Graph Scaffolds for Structural Reasoning in Large Language Models」と題する論文を発表した。この研究は、大規模言語モデル (LLM) が複雑な構造化推論を行う際、グラフが単なる外部知識源としてだけでなく、推論プロセスを整理する内部的な足場 (スキャフォールド) としても機能する可能性を示唆している。人間がマインドマップを用いて思考を整理する仕組みから着想を得ており、LLMの推論能力向上に新たな視点を提供する。
arXiv cs.AIは2026年4月20日(現地時間)、大規模言語モデル (LLM) の推論過程における冗長性に関する研究結果を発表した。Zhiyuan Zhai氏らによるこの研究は、LLMが複雑な問題解決で生成する長い「思考の連鎖」がレイテンシー、GPU時間、エネルギーに多大なコストをもたらす現状に着目。推論過程で実際にどれほどの熟慮が必要かを大規模に測定し、その根本原因を解明することを目的としている。