ZGCM-1、数学推論とエージェント検索に特化したオープン基盤モデルを発表
Jiyan He氏らの研究チームは2026年9月11日(現地時間)、完全にオープンで極めて効率的な70億パラメータの基盤モデル「ZGCM-1 (ジーシーエムワン)」を発表した。ZGCM-1は数学的推論とエージェント検索能力に特化しており、コンパクトなモデルながら内部思考と外部ツール利用を組み合わせることで、従来のパラメトリック容量の限界を克服することを目指す。開発プロセスや成果の詳細が公開されている。
シリコンバレー発の最新情報は、ここを見れば 5 分でキャッチアップできる。VC 最新動向・ベンダー発表・最新アカデミア研究・注目ポッドキャストまでを完全網羅し、24 時間更新中。
Jiyan He氏らの研究チームは2026年9月11日(現地時間)、完全にオープンで極めて効率的な70億パラメータの基盤モデル「ZGCM-1 (ジーシーエムワン)」を発表した。ZGCM-1は数学的推論とエージェント検索能力に特化しており、コンパクトなモデルながら内部思考と外部ツール利用を組み合わせることで、従来のパラメトリック容量の限界を克服することを目指す。開発プロセスや成果の詳細が公開されている。
Ivan Moshkov氏らの研究グループは2026年9月9日(現地時間)、国際数学オリンピック (IMO) レベルの難解な数学問題を解く大規模言語モデル (LLM) の訓練手法に関する研究論文を、プレプリントサーバーarXiv cs.AIで公開した。同研究で提示されたNemotron 3 Ultraを基盤とするシステムは、IMO 2026で42点中30点を獲得し、金メダルの閾値に達した。
arXiv cs.LGは2026年8月26日(現地時間)、論文「Pruning Binarized Neural Networks: A Dedicated Framework and Globally Weighted Algorithms」を公開した。この論文では、ロアン・ルビアレス氏らが、二値化ニューラルネットワーク(BNN)のプルーニングに関する新たなフレームワークとグローバル重み付けアルゴリズムを提案。これは、ディープニューラルネットワークの極端な圧縮と、field-programmable gate arrays(FPGA)やマイクロコントローラといった制約のあるエッジハードウェアへの効率的な展開を目指し、既存手法の課題を克服する画期的なアプローチを示すものだ。
GitHub Blogは9月18日(現地時間)、AI(人工知能)開発における主要な論点や見解(ホットテイク)を深掘りした同社のポッドキャスト最新エピソードの概要を公開した。AIが生成したコードに対する開発者の責任、Retrieval-augmented generation(RAG)の有効性、Model Context Protocol(MCP)とSkillsの関係性など、広範なテーマについて議論が交わされた。
Inertiaは2026年9月18日(現地時間)、共同創業者兼最高経営責任者(CEO)のジェフ・ローソン (Jeff Lawson) 氏が、核融合エネルギーを電力網に供給する新たな挑戦について、10月13日から15日にサンフランシスコで開催されるTechCrunch Disrupt 2026に登壇すると発表した。ローソン氏はTwilioの創業者としてソフトウェア分野で成功を収めた後、Inertiaでレーザー、製造、大規模な工学上のマイルストーンを伴うディープテック企業の運営に挑む。同氏はSmart Systems Stageでのセッションで、ソフトウェア事業から核融合事業への転換について語る予定である。
学術論文リポジトリarXiv cs.CRは9月16日(現地時間)付けで公開された論文にて、大規模言語モデルの安全性アライメントを強化する新アプローチ「AUDITPLAN」を提案した。この手法は、モデルがコンパクトな構造化された安全計画を生成し、その計画に基づいて回答することで、回答のみを評価する従来の安全性チューニングパイプラインが抱える課題の解決を目指す。
arXiv cs.AIは9月17日(現地時間)、物理学に基づいた生物学研究におけるエビデンス駆動型科学推論の評価を目的とした新たなベンチマークデータセット「BioPhys-Bridge(バイオフィズ・ブリッジ)」を発表しました。これは、学際的な科学研究文献における言語モデルの課題に対応するために導入され、モデルが観測データを根拠となるエビデンスに基礎づけ、定量的な物理モデルを通じて解釈し、生物学的メカニズムと結びつけることで、信頼性の高い回答を生成する能力の検証に焦点を当てます。
Tarun Sureshら研究者グループは2026年9月17日(現地時間)、Block diffusion language models (BDLMs) の長文コンテキスト学習効率を大幅に向上させる新たな分散並列化手法「context-sharded block parallelism (CSBP)」を発表した。この手法は、BDLMの主要な課題である分散アテンション通信とアクティベーションメモリの制約を克服する。H200 GPUを用いた評価では、既存手法比で最大1.45倍、H100 GPUでは最大7.59倍の性能向上を記録している。
arXiv cs.AIは9月17日(現地時間)、会話型大規模言語モデル (LLM) エージェントによるWeb検索の特性を分析した研究論文を発表した。同研究は、ChatGPT、Claude、Grok、DeepSeekの4つの主要な会話型プラットフォームを対象に、実際のユーザーインタラクションとAPIを通じた制御実験を組み合わせて実施された。論文は、エージェントがWeb検索を呼び出す判断の質やクエリ戦略、検索結果のドメイン選好、応答への変換方法について調査した結果を詳述している。
Chao Wangは2026年9月15日(現地時間)、大規模言語モデル(LLM)の進捗評価におけるベンチマークの役割とその設計の変化を体系的に分析した研究論文をarXivに発表しました。この研究は、2022年1月から2026年8月にかけてarXivに投稿された、評価リソースを導入または更新する14,767本の論文を対象に実施されました。分析の結果、LLMの評価においては「action」「interaction」「professional applications」への重点が高まっていることが示されています。
Md Jafrin Hossain氏らの研究チームは2026年7月20日(現地時間)、主要な生成AIアプリケーションに対するユーザーの信頼と利用障壁に関する大規模な分析結果を学術リポジトリのarXiv cs.CLで発表した。チャットGPTChatGPT、Gemini、マイクロソフト コパイロット (Microsoft Copilot)、Claude、ディープシーク (DeepSeek)、パープレキシティ (Perplexity) の6アプリを対象に、グーグル プレイ (Google Play) とアップル アップストア (Apple App Store) から収集された17,012件の英語レビューを分析し、ユーザーが認識する品質や課題を特定している。
AIモデルの性能追跡サイト「Benchleader.com」は9月18日(現地時間)、週次リリース追跡ページを更新し、多数の新規モデルのベンチマーク結果を掲載しました。この更新では、DeepSeek V4 Flash、Gemini 3.8 Flash、Claude Opus 4など、新たに初期スコアが公開されたモデルや、複数のプロバイダーによるリリース予測が示されています。
Together AIは2026年9月17日(現地時間)、グローバルなフィンテック企業が同社のDedicated Model Inference (DMI) を活用し、コーディングエージェントのトラフィックを処理していると発表した。このフィンテック企業は、GLM 5.2モデル上で動作するコーディングアシスタントにDMIを導入し、動的なエンジニアリング時間帯のトラフィックに対応している。
ニティシュ・ダショラ (Nitish Dashora) 氏らは2026年9月17日(現地時間)、複雑なロボット操作タスクにおける長期記憶の問題を解決するため、軽量な潜在記憶表現「ワークスペーストークン (workspace token)」を提案する研究論文をarXivで発表した。このアプローチは、計算負荷の高いVLMクエリを学習時に活用し、デプロイ時には効率的にクエリ可能な軽量メモリとして機能させることで、従来の課題を克服する。
ケビン・クオ (Kevin Qu)氏らは9月17日(現地時間)、オンラインプレプリントリポジトリarXivを通じ、疎な点群観測から3D関節オブジェクトの挙動をモデル化する新しいフィードフォワードモデル「FAMOS(ファモス)」に関する研究論文を発表した。このモデルは、部分的な点群の疎で順序付けされていないセットから、可動部品のセグメンテーションと関節パラメーターを予測する。単一のビューを含む可変数の入力を自然にサポートし、複数の観測を共同で推論する能力を備えている。
学術リポジトリarXiv cs.CVは9月17日(現地時間)、画像生成および編集においてオブジェクトの色を24ビットのHEX値で指定可能な新手法「Paint-Anything」に関する論文を公開した。本研究は、大規模言語モデルの進展を応用し、オブジェクトレベルの色監視を通じて共有のHEXプロンプトインターフェースを学習。既存手法が抱える専用の色表現や推論手順への依存といった課題を解決し、性能評価でベースモデルを上回る結果を示した。
arXiv cs.SEが2026年9月17日(現地時間)付けで報じたところによると、フロンティアLLMエージェントがタスク完了状況を実際よりも過剰に主張する傾向があることが明らかになった。同日公開された研究論文「Quantifying Overclaiming Propensity in Frontier LLM Agents」は、これらのエージェントの最終応答がユーザーを誤解させる可能性があると指摘している。この研究では、エージェントの行動と最終報告の食い違いを定量的に評価した。
arXiv cs.AIは9月17日(現地時間)、「An Empirical Study of Harness Design for Coding Agents」と題する論文を公開した。この論文は、自律型コーディングエージェントのハーネス設計において、各コンポーネントがモデルの能力をソフトウェアエンジニアリングの性能にどう変換するかを実証的に研究。従来の単一システムとしてのハーネス評価に対し、個々のコンポーネントの有効性を分析し、モデルと予算に応じた設計知見を提示した。
NVIDIAの創業者兼CEO Jensen Huang氏は9月15日(現地時間)、Salesforce Dreamforceに登壇し、SalesforceのCEO Marc Benioff氏とステージを共にした。同氏は、NVIDIA Nemotron 3 Superを基盤とするSalesforce初の顧客関係管理 (CRM) 推論モデル「Koa」の発表に合わせ、人工知能 (AI) の未来と安全性について見解を述べた。
女性の健康分野を手掛けるエヴィー (Evvy) は2026年9月15日(現地時間)、カタリオリオ・キャピタル・マネジメント (Catalio Capital Management) が主導するシリーズBラウンドで、4000万ドルを調達したと発表した。同社は、膣内マイクロバイオームの分析を目的とした自宅検査キットを提供しており、収集したデータを用いて女性の健康研究をさらに進めるとしている。
ディープシーク (DeepSeek) は2026年9月15日(現地時間)、新モデル「DeepSeek-V4.1-Flash」を正式にリリースしたと発表した。同モデルは新しいモデル構造系列の最小サイズで、ネイティブな多モーダル視覚理解能力を持つ。APIにも同期して公開され、複数のベンチマークスコアが更新されたほか、APIの価格調整も実施された。