Google DeepMind 正式發佈 EmbeddingGemma 2,這是一款開放的多模態嵌入模型,可將文本、代碼、圖像、視頻和音頻統一映射到同一個 768 維向量空間。該模型擁有 740M 參數、8,192 token 的上下文窗口,採用 Apache 2.0 許可,主要面向端側搜索、分類以及隱私優先的 RAG 場景。目前權重已在 Hugging Face 和 Kaggle 上線,並同步提供 Ollama、llama.cpp GGUF 與 LiteRT 構建版本,開發者可以立即部署使用。
嵌入模型的作用是把內容轉換成能夠表達含義的數字向量,語義相近的內容在向量空間中彼此靠近,因此便於檢索和比較。在 RAG 流程中,這些向量讓大語言模型能夠取回訓練數據之外的最新信息。在本地生成嵌入可以讓數據保留在設備上,同時降低延遲並支持離線運行。
EmbeddingGemma 2 基於 Gemma 4 架構,設計高度模塊化,由三個部分組成:文本與代碼骨幹網絡為 270M 參數(其中 130M 為 transformer、140M 為 embedder);視覺編碼器為 170M 參數,可選加載;音頻編碼器為 300M 參數,同樣可選。開發者可以按需組合,純文本只需 270M,文本加視覺為 440M,文本加音頻為 570M,全部模態則為 740M,而且所有配置共享同一個向量空間——用純文本配置生成的查詢向量,可以直接匹配由完整模型嵌入的文檔。模型支持跨模態檢索,例如用文字查詢檢索照片,或用語音備忘錄檢索視頻片段;像同時包含文字、圖片和演示視頻的商品頁面這樣的交錯輸入,也會生成單一嵌入。上下文窗口為 8,192 token,相比第一代擴大 4 倍,約可容納 29 張圖片、58 幀視頻或 5.5 分鐘音頻。
在基準測試方面,Google 研究團隊稱該模型在參數低於 10 億的多模態嵌入模型中取得領先成績,尤其在 MTEB Code 和 MAEB 上表現突出。768 維全精度結果包括:MTEB 多語言 v2 為 61.36(第一代為 61.15);MTEB Code v1 為 78.68(第一代為 68.76);MIEB lite 圖像任務為 64.64;MMEB v2 整體為 59.01;MSEB 聲音檢索為 69.54;MAEB 音頻為 49.39。代碼檢索提升 9.92 分,約 14%,多語言文本質量保持穩定。不過,規模更大的模型仍在部分榜單上領先,例如 Qwen3-VL-Embedding-2B 在其自測的 MMEB-V2 上報告 73.2,參數量約為 2.7 倍,且不支持音頻。
在端側部署方面,量化後的 EmbeddingGemma 2 在 Pixel 11 Pro 上,純文本權重的活躍內存約為 191MB,完整多模態模型約需 567MB。量化感知訓練把權重壓縮為 INT4 和 INT8。Google AI Edge 團隊在 MacBook M5 Pro GPU 上測得每張圖片 37.3 毫秒的處理速度,使用的是 70 token 的視覺預算。Matryoshka 表示學習(MRL)允許開發者把向量截斷到 512、256 或 128 維:從 768 維降到 128 維最多可減少 6 倍存儲;在 256 維時,MTEB 多語言僅從 61.36 微降到 60.41;在 128 維時,MMEB 降至 45.65,因此 Google 建議 128 維主要用於純文本工作負載。
與最接近的競品相比,EmbeddingGemma 2 的定位較為獨特。對比對象包括 EmbeddingGemma 1、Qwen3-VL-Embedding-2B、LCO-Embedding-Omni-3B 和 Gemini Embedding 2。參數規模上分別為 740M(純文本 270M)、308M、2B、3B 骨幹(Hugging Face 頁面標註為 5B)以及未披露。文本和代碼方面五者均支持;圖像和視頻方面除第一代外基本都支持;音頻方面 EmbeddingGemma 2 與 LCO 支持,Qwen 不支持,Gemini 支持。輸出維度上,EmbeddingGemma 2 為 768(可截斷至 512、256、128),Gemini 為 3072(128 至 3072),Qwen 最高 2048。上下文長度分別為 8,192、2K、32K、未説明和 8,192 token。語言覆蓋方面前三者與 Gemini 均為 100 多種,Qwen 為 30 多種。許可與訪問方式上,EmbeddingGemma 2、Qwen 和 LCO 均為 Apache 2.0 開放權重,第一代按 Gemma 條款開放,Gemini 僅提供付費 API。公佈端側內存的只有 EmbeddingGemma 2(文本約 191MB、全模態約 567MB)和第一代(低於 200MB)。
運行方式上,EmbeddingGemma 2 支持 sentence-transformers v6.1.0 及以上版本、Transformers、vLLM、SGLang、MLX、llama.cpp、Ollama、LM Studio、LiteRT 與 MediaPipe。向量存儲可使用 Qdrant,微調可使用 Unsloth。面向 Android 的 ML Kit 支持及 NPU 加速預計將在數週內推出。典型用法是先安裝支持圖像、音頻、視頻的 sentence-transformers 與 transformers,然後加載 google/embeddinggemma-2,分別用 SearchQuery 和 Document 提示詞對查詢與文檔編碼,再計算相似度。在 Ollama 上可執行 ollama pull embeddinggemma-2,標籤從 270m(378MB)到 740m(1.3GB)不等,演示可在 Google AI Edge Gallery 中查看。
綜合來看,EmbeddingGemma 2 的要點包括:一個 740M 的開放模型把五種模態嵌入共享的 768 維空間;模塊化編碼器讓佔用從 270M 擴展到 740M;代碼檢索從 68.76 躍升至 78.68;量化後在 Pixel 11 Pro 上內存佔用介於約 191MB 到 567MB 之間。常見問題方面,該模型可以商用,因為採用 Apache 2.0 許可;內存需求則如 Google 所報告,量化後純文本約 191MB,全模態約 567MB。