本文にスキップ
AI News HubLIVE
サイト内リライト4 分で読了

Google DeepMind、Gemma 4ベースの740Mオープン・マルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開

記事の要約

Google DeepMindは、テキスト・コード・画像・動画・音声を単一の768次元空間に埋め込むEmbeddingGemma 2を公開した。740Mパラメータ、8Kトークンのコンテキストウィンドウ、Apache 2.0ライセンスを備え、オンデバイス検索、分類、プライバシー重視のRAGを狙う。重みはHugging FaceとKaggleで公開され、Ollama、llama.cpp GGUF、LiteRTビルドも利用可能だ。

ソースMarkTechPost著者: Asif Razzaq
Google DeepMind、Gemma 4ベースの740Mオープン・マルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

Google DeepMindは、テキスト、コード、画像、動画、音声を同一の768次元ベクトル空間に埋め込むオープンなマルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開した。740Mパラメータ、8,192トークンのコンテキストウィンドウを備え、Apache 2.0ライセンスで提供される。主な用途はオンデバイス検索、分類、そしてプライバシーを優先するRAGだ。重みはHugging FaceとKaggleで公開され、Ollama、llama.cpp GGUF、LiteRTの各ビルドも用意されているため、すぐに導入できる。

埋め込みモデルとは、コンテンツを意味を捉えた数値ベクトルに変換するもので、意味が近いもの同士はベクトル空間上で近くに配置されるため、検索や比較が容易になる。RAGのパイプラインでは、こうしたベクトルによってLLMが学習していない最新情報を取得できる。埋め込みをローカルで生成すればデータをデバイス内に留められ、遅延を抑え、オフラインでも動作する。

EmbeddingGemma 2はGemma 4アーキテクチャを基盤とし、モジュール式の設計を採用している。構成は3つで、テキストとコードのバックボーンが270Mパラメータ(130MのTransformerと140Mのエンベッダー)、視覚エンコーダが170Mパラメータ(オプション)、音声エンコーダが300Mパラメータ(オプション)だ。開発者は必要な部分だけを読み込める。テキストのみなら270M、テキストと視覚で440M、テキストと音声で570M、すべてを含めると740Mになる。しかもすべての構成が同一のベクトル空間を共有するため、テキスト専用構成で埋め込んだクエリが、フルモデルで埋め込んだ文書にそのまま一致する。テキストによる画像検索や、ボイスメモによる動画クリップ検索といったクロスモーダル検索が可能で、テキスト・画像・デモ動画が混在する商品ページのようなインターリーブ入力も単一の埋め込みを生成する。コンテキストウィンドウは8,192トークンで、バージョン1より4倍広く、約29枚の画像、58フレームの動画、5.5分の音声に相当する。

ベンチマークでは、Googleの研究チームは10億パラメータ未満のマルチモーダル埋め込みモデルの中で、特にMTEB CodeとMAEBで先行するスコアを報告している。768次元のフル精度での結果は以下の通りだ。MTEB多言語v2は61.36(バージョン1は61.15)、MTEB Code v1は78.68(同68.76)、MIEB lite(画像)は64.64、MMEB v2全体は59.01、MSEB検索(音)は69.54、MAEB(音声)は49.39。コード検索は9.92ポイント、約14%向上し、多言語テキストの品質は安定している。ただし、より大規模なモデルが一部のベンチマークでは依然として優位にある。たとえばQwen3-VL-Embedding-2Bは自身のMMEB-V2実行で73.2を報告しており、パラメータ数は約2.7倍だが音声には対応していない。

オンデバイス展開では、量子化したEmbeddingGemma 2をPixel 11 Proで動かした場合、テキスト専用の重みでアクティブRAMは約191MB、フルマルチモーダルモデルでは約567MBとなる。量子化認識トレーニングにより重みはINT4とINT8に圧縮される。Google AI Edgeチームは、70トークンの視覚バジェットを使い、MacBook M5 Pro GPU上で1画像あたり37.3ミリ秒を計測した。Matryoshka表現学習(MRL)により、開発者はベクトルを512、256、128次元に切り詰められる。768次元から128次元にするとストレージを最大6倍削減できる。256次元ではMTEB多言語が61.36から60.41へわずかに低下するだけだが、128次元ではMMEBが45.65まで落ちるため、Googleは128次元を主にテキスト専用ワークロード向けと推奨している。

競合との比較では、EmbeddingGemma 2の位置づけは際立っている。比較対象はEmbeddingGemma 1、Qwen3-VL-Embedding-2B、LCO-Embedding-Omni-3B、Gemini Embedding 2だ。パラメータ数はそれぞれ740M(テキスト専用270M)、308M、2B、3Bバックボーン(Hugging Face上は5Bと記載)、非公開。テキストとコードはすべてが対応し、画像と動画は初代を除きおおむね対応している。音声はEmbeddingGemma 2とLCOが対応し、Qwenは非対応、Geminiは対応する。出力次元はEmbeddingGemma 2が768(512、256、128に切り詰め可能)、Geminiが3072(128〜3072)、Qwenが最大2048。コンテキスト長は8,192、2K、32K、未記載、8,192トークン。言語数はEmbeddingGemma 2、初代、Geminiが100以上、Qwenが30以上。ライセンスとアクセスは、EmbeddingGemma 2、Qwen、LCOがApache 2.0のオープンウェイト、初代はGemma条件のオープンウェイト、Geminiは有料APIのみ。オンデバイスRAMを公表しているのはEmbeddingGemma 2(テキスト約191MB、フル約567MB)と初代(200MB未満)だけだ。

実行環境は、sentence-transformers v6.1.0以降、Transformers、vLLM、SGLang、MLX、llama.cpp、Ollama、LM Studio、LiteRT、MediaPipeに対応する。ベクトルストレージにはQdrant、ファインチューニングにはUnslothが使える。Android向けのML KitサポートとNPUアクセラレーションは数週間以内に提供予定だ。典型的な使い方は、画像・音声・動画に対応したsentence-transformersとtransformersをインストールし、google/embeddinggemma-2を読み込み、SearchQueryとDocumentのプロンプト名でクエリと文書をそれぞれエンコードして類似度を計算するという流れになる。Ollamaではollama pull embeddinggemma-2を実行でき、タグは270m(378MB)から740m(1.3GB)まで用意されている。デモはGoogle AI Edge Galleryで確認できる。

まとめると、740Mのオープンモデルがテキスト、コード、画像、動画、音声を共通の768次元空間に埋め込むこと、モジュール式エンコーダによってフットプリントを270Mから740Mまで拡張できること、コード検索が68.76から78.68へ跳ね上がること、量子化によりPixel 11 Proで約191MBから約567MBのRAMで動作することが要点だ。よくある質問については、Apache 2.0ライセンスのため商用利用が可能であり、メモリ要件はGoogleの報告によれば量子化時にテキスト専用で約191MB、フルマルチモーダルで約567MBとなる。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 単一の740Mモデルがテキスト・コード・画像・動画・音声を共通の768次元空間に埋め込み、270Mのテキスト専用から740Mのフルマルチモーダルまでモジュール式に選択できる。
  • MTEB Codeの検索スコアは68.76から78.68へ向上し、多言語は61.36を維持。コンテキスト長は8,192トークンで前世代の4倍。
  • 量子化によりPixel 11 Proでテキストのみ約191MB、フルマルチモーダル約567MBのRAMで動作し、MRLで512・256・128次元への切り詰めが可能。
  • Apache 2.0のオープンウェイトで、sentence-transformers、Ollama、llama.cpp、LiteRTなどに対応。Android向けML KitのNPUアクセラレーションも近日提供予定。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。