ベンダー・製品

【速報】Hugging Face、マルチモーダルエンコーダー「NeoMME」発表

Hugging Faceは2026年9月2日(現地時間)、効率的なマルチモーダル・マルチリンガルエンコーダー「NeoMME」を発表した。このモデルは2億6000万と8億の2つのサイズで提供され、単一の双方向Transformerがテキストトークンと生の画像パッチの両方を処理する。事前学習済みのビジョンタワーや因果言語モデルを使用しないアーキテクチャが特徴である。

リサーチ・論文

視覚優先マルチモーダルRAG「PlanSightRAG」が登場

ナバラージ・スベディ (Nabaraj Subedi) 氏ら4名の研究者グループは2026年8月26日(現地時間)、土木標準計画の質疑応答とコンプライアンスチェックを自動化するための視覚優先マルチモーダルRetrieval-Augmented Generation (RAG) フレームワーク「PlanSightRAG」を発表した。このフレームワークは、従来の光学文字認識 (OCR) ベースの自動化で失われがちだった計画図面の幾何学的情報とレイアウトを直接解析する。

ベンダー・製品

Black Forest Labs、動画モデル「FLUX 3」発表 2026年8月より順次提供へ

Black Forest Labsは2026年8月4日(現地時間)、画像、動画、音声を横断学習した初の動画モデル「FLUX 3」のプレビュー提供を開始すると発表しました。同モデルは同期音声付き動画の生成を特徴とする見込みです。2026年8月11日(現地時間)には、このFLUX 3を活用した動画生成機能がFLUX MCP serversに導入され、ClaudeやCursorといったMCP互換クライアントから直接利用が可能となる見込みです。

ポッドキャスト・動画

シンキング・マシーンズ・ラボ、マルチモーダルLLM「Inkling」を公開

シンキング・マシーンズ・ラボ (Thinking Machines Lab) は2026年7月16日(現地時間)、初の本格的な大規模言語モデル (LLM) ファミリー「Inkling」をオープンウェイトで正式リリースした。Inklingは975B (総パラメータ数) / 41B (アクティブパラメータ数) のMixture-of-Experts (MoE) モデルで、Apache 2.0ライセンスの下で提供される。同時に、より軽量なInkling-Small (276B/12B) のプレビューも公開された。

ベンダー・製品

Together AI、マルチモーダルMoEモデル「インクリング」提供開始

Together AIは2026年7月15日(現地時間)、シンキング・マシーンズ・ラボ (Thinking Machines Lab) が開発した新しいマルチモーダルな混合専門家(MoE)モデル「インクリング (Inkling)」を、同社の推論プラットフォームで提供開始した。インクリングはテキスト、画像、音声を入力として受け入れ、テキストを出力する。制御可能な推論努力をサポートし、開発者が各タスクのニーズに応じてモデルの推論適用度を調整できる点が特徴である。

リサーチ・論文

arXiv、画像作成編集AI「CanvasAgent」とデータセット発表

arXivは7月6日(現地時間)、複雑な画像作成と編集を支援する新たなマルチモーダルエージェント「CanvasAgent(キャンバスエージェント)」と、大規模なツール利用データセット「CanvasCraft(キャンバスクラフト)」に関する研究論文を発表した。本研究は、既存の画像生成技術が抱える単一モデルでの多様な視覚タスク対応の限界や、ツール利用エージェントにおける教師データ不足の課題を克服することを目指す。複数のビジュアルツールを連携させることで、画像合成やオブジェクトの局所化、領域分割、コンテンツ編集といった広範なプロセスを最適化する。

リサーチ・論文

Google DeepMind、ノートPC向けマルチモーダルAI「Gemma 4 12B」公開

Google DeepMindは6月3日(現地時間)、ノートPC上で高性能なマルチモーダルインテリジェンスを実現する新モデル「Gemma 4 12B」を発表した。このモデルは、エッジ向けE4Bと高度な26B MoEの中間に位置する性能を目指し、メモリ使用量を抑えつつ強力な機能を搭載。エンコーダーフリーのアーキテクチャによりレイテンシとメモリ消費を大幅に削減し、同社ミッドサイズモデルとして初めてネイティブオーディオ入力に対応した詳細が明らかになった。