【速報】Hugging Face、マルチモーダルエンコーダー「NeoMME」発表
Hugging Faceは2026年9月2日(現地時間)、効率的なマルチモーダル・マルチリンガルエンコーダー「NeoMME」を発表した。このモデルは2億6000万と8億の2つのサイズで提供され、単一の双方向Transformerがテキストトークンと生の画像パッチの両方を処理する。事前学習済みのビジョンタワーや因果言語モデルを使用しないアーキテクチャが特徴である。
Tag
13 件の関連記事
Hugging Faceは2026年9月2日(現地時間)、効率的なマルチモーダル・マルチリンガルエンコーダー「NeoMME」を発表した。このモデルは2億6000万と8億の2つのサイズで提供され、単一の双方向Transformerがテキストトークンと生の画像パッチの両方を処理する。事前学習済みのビジョンタワーや因果言語モデルを使用しないアーキテクチャが特徴である。
ナバラージ・スベディ (Nabaraj Subedi) 氏ら4名の研究者グループは2026年8月26日(現地時間)、土木標準計画の質疑応答とコンプライアンスチェックを自動化するための視覚優先マルチモーダルRetrieval-Augmented Generation (RAG) フレームワーク「PlanSightRAG」を発表した。このフレームワークは、従来の光学文字認識 (OCR) ベースの自動化で失われがちだった計画図面の幾何学的情報とレイアウトを直接解析する。
Black Forest Labsは2026年8月4日(現地時間)、画像、動画、音声を横断学習した初の動画モデル「FLUX 3」のプレビュー提供を開始すると発表しました。同モデルは同期音声付き動画の生成を特徴とする見込みです。2026年8月11日(現地時間)には、このFLUX 3を活用した動画生成機能がFLUX MCP serversに導入され、ClaudeやCursorといったMCP互換クライアントから直接利用が可能となる見込みです。
Metaは8月10日(現地時間)、ローカル環境でのエージェント利用に特化した新しいマルチモーダルモデル「ミューズ・グリマー(Muse Glimmer)」をオープンソースとして発表した。このモデルは、既存のMuseから300億パラメータに蒸留され、Apache 2.0 licenseのもとで提供される。特にプライバシー保護を重視するアプリケーションでの利用を目的としている。
Alibaba Qwenは8月3日(現地時間)、総パラメータ数2.4兆の混合専門家(MoE)モデル「Qwen3.8-Max」の一般提供を開始した。本モデルはテキスト、画像、動画を入力とし、テキストを出力するマルチモーダル機能を備える。API版は即座に展開可能で、OpenAIおよびDashScopeと互換性を持つ。より小規模な「Qwen3.8-27B」と併せて、次週にはオープンウェイト版の提供も予定されている。
Google DeepMindは2026年8月1日(現地時間)、生成AIモデル「Gemini 3.6 Flash」の一般提供を開始した。同モデルは、既存の「Gemini 3.5 Flash」と比較して、コーディング、知識作業、およびマルチモーダル性能を向上させながら、トークン効率の改善を実現している。エージェントワークフローやコーディングタスクに最適化されている。
シンキング・マシーンズ・ラボ (Thinking Machines Lab) は2026年7月16日(現地時間)、初の本格的な大規模言語モデル (LLM) ファミリー「Inkling」をオープンウェイトで正式リリースした。Inklingは975B (総パラメータ数) / 41B (アクティブパラメータ数) のMixture-of-Experts (MoE) モデルで、Apache 2.0ライセンスの下で提供される。同時に、より軽量なInkling-Small (276B/12B) のプレビューも公開された。
Together AIは2026年7月15日(現地時間)、シンキング・マシーンズ・ラボ (Thinking Machines Lab) が開発した新しいマルチモーダルな混合専門家(MoE)モデル「インクリング (Inkling)」を、同社の推論プラットフォームで提供開始した。インクリングはテキスト、画像、音声を入力として受け入れ、テキストを出力する。制御可能な推論努力をサポートし、開発者が各タスクのニーズに応じてモデルの推論適用度を調整できる点が特徴である。
Metaは7月9日(現地時間)、マルチモーダル推論モデル「Muse Spark 1.1」を発表し、これにアクセスする「Meta Model API」のパブリックプレビューを開始した。Muse Spark 1.1はエージェントタスクに特化しており、ツール利用、コーディング、マルチモーダル理解の能力を強化。開発者向けにAPI市場へ提供されることで、既存のシステムへの新たな選択肢として評価が求められる。
arXivは7月6日(現地時間)、複雑な画像作成と編集を支援する新たなマルチモーダルエージェント「CanvasAgent(キャンバスエージェント)」と、大規模なツール利用データセット「CanvasCraft(キャンバスクラフト)」に関する研究論文を発表した。本研究は、既存の画像生成技術が抱える単一モデルでの多様な視覚タスク対応の限界や、ツール利用エージェントにおける教師データ不足の課題を克服することを目指す。複数のビジュアルツールを連携させることで、画像合成やオブジェクトの局所化、領域分割、コンテンツ編集といった広範なプロセスを最適化する。
ミストラルAI (Mistral AI) は6月12日(現地時間)、開発者向けドキュメント「Changelogs」を更新し、最新のマルチモーダルモデル「Mistral Medium 3.5」をオープンウェイトで公開したことを明らかにした。このモデルはエージェント機能とコーディングタスクに最適化されており、推論能力を調整可能な「reasoning_effort」パラメータを搭載している。同社はまた、既存モデルの更新や新たなテキスト読み上げモデルのリリースなど、継続的な製品強化を進めている。
arXiv cs.CLが2026年4月17日(現地時間)付けで報じた。Manh Luong氏らが論文「MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models」を発表し、視覚、音声、テキストを統合処理するOmni Large Language Models (LLMs) の安全性評価に特化した新たなベンチマーク「MCBench」を導入した。従来のマルチモーダル安全性ベンチマークが視覚入力に限定されていたのに対し、MCBenchは複数のモダリティの統合を必要とする1196の多様なシナリオと4つの安全カテゴリを網羅する。
Google DeepMindは6月3日(現地時間)、ノートPC上で高性能なマルチモーダルインテリジェンスを実現する新モデル「Gemma 4 12B」を発表した。このモデルは、エッジ向けE4Bと高度な26B MoEの中間に位置する性能を目指し、メモリ使用量を抑えつつ強力な機能を搭載。エンコーダーフリーのアーキテクチャによりレイテンシとメモリ消費を大幅に削減し、同社ミッドサイズモデルとして初めてネイティブオーディオ入力に対応した詳細が明らかになった。