Google DeepMindは2026年10月5日(現地時間)、テキスト、画像、音声、動画といった複数のメディアタイプを統合し、単一の埋め込み空間にマッピングするマルチモーダル埋め込みモデル「EmbeddingGemma 2」の提供を開始した。同モデルは7億4千万のパラメータを持ち、オンデバイスでの推論に最適化された軽量設計が特徴である。

EmbeddingGemma 2は、Gemma 4アーキテクチャを基盤とし、Apache 2.0ライセンスでリリースされた。このモデルは、MTEB CodeやMAEBなどのベンチマークにおいて、10億パラメータ未満のマルチモーダル埋め込みモデルの中で優れたスコアを達成している。テキスト専用ワークロードでは2億7千万パラメータ、オプションのビジョンエンコーダ(1億7千万)、オーディオエンコーダ(3億)を追加することで、完全なマルチモーダルサポートを提供する。

Matryoshka Representation Learning(MRL)を活用することで、開発者は出力ベクトルを768次元から512、256、または128次元に動的に切り詰めることができ、これによりローカルのベクトルデータベースやメモリ使用量において最大6倍のストレージ削減が可能となる。Google Pixel 11 Proにおけるテストでは、テキスト専用の重みで約191MB、フルマルチモーダルモデルで約567MBのアクティブRAMを必要とする。

また、EmbeddingGemma 2は8Kトークンのコンテキストウィンドウを搭載しており、最大5.5分の音声、29枚の画像、58フレームの動画、またはそれらの組み合わせをローカルハードウェア上で直接処理できる。これにより、データプライバシーの確保、パイプラインの遅延削減、オフラインでのクロスモーダル検索および取得といった機能が実現される。

同モデルは、Google AI Edge GalleryのInstant Media SearchやVideo Moments Finder、Google AI Edge Foresightアプリなどで利用可能。モデルウェイトはHugging FaceとKaggleで提供されており、Gemini Enterprise Agent Platform Model Gardenでも近日中に利用可能となる。


参考: DeepMind Blog — 2026年10月6日 09:00 (JST)

この記事をシェア
X はてブ LinkedIn