跳到主要內容
AI News HubLIVE
站內改寫3 分鐘閱讀

Google DeepMind 釋出 EmbeddingGemma 2:基於 Gemma 4 的 740M 開源多模態嵌入模型

文章摘要

Google DeepMind 推出 EmbeddingGemma 2,將文本、程式碼、影像、影片和音訊對映到同一個 768 維向量空間。該模型擁有 740M 引數、8K token 上下文視窗,並以 Apache 2.0 許可開放權重,面向端側搜尋、分類和隱私優先的 RAG。權重已在 Hugging Face 與 Kaggle 上線,同時提供 Ollama、llama.cpp GGUF 和 LiteRT 版本,可立即部署。

來源MarkTechPost作者: Asif Razzaq
Google DeepMind 釋出 EmbeddingGemma 2:基於 Gemma 4 的 740M 開源多模態嵌入模型
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

Google DeepMind 正式釋出 EmbeddingGemma 2,這是一款開放的多模態嵌入模型,可將文本、程式碼、影像、影片和音訊統一對映到同一個 768 維向量空間。該模型擁有 740M 引數、8,192 token 的上下文視窗,採用 Apache 2.0 許可,主要面向端側搜尋、分類以及隱私優先的 RAG 場景。目前權重已在 Hugging Face 和 Kaggle 上線,並同步提供 Ollama、llama.cpp GGUF 與 LiteRT 構建版本,開發者可以立即部署使用。

嵌入模型的作用是把內容轉換成能夠表達含義的數字向量,語義相近的內容在向量空間中彼此靠近,因此便於檢索和比較。在 RAG 流程中,這些向量讓大語言模型能夠取回訓練資料之外的最新資訊。在本地生成嵌入可以讓資料保留在裝置上,同時降低延遲並支援離線執行。

EmbeddingGemma 2 基於 Gemma 4 架構,設計高度模組化,由三個部分組成:文本與程式碼骨幹網路為 270M 引數(其中 130M 為 transformer、140M 為 embedder);視覺編碼器為 170M 引數,可選載入;音訊編碼器為 300M 引數,同樣可選。開發者可以按需組合,純文本只需 270M,文本加視覺為 440M,文本加音訊為 570M,全部模態則為 740M,而且所有配置共享同一個向量空間——用純文本配置生成的查詢向量,可以直接匹配由完整模型嵌入的文件。模型支援跨模態檢索,例如用文字查詢檢索照片,或用語音備忘錄檢索影片片段;像同時包含文字、圖片和演示影片的商品頁面這樣的交錯輸入,也會生成單一嵌入。上下文視窗為 8,192 token,相比第一代擴大 4 倍,約可容納 29 張圖片、58 幀影片或 5.5 分鐘音訊。

在基準測試方面,Google 研究團隊稱該模型在引數低於 10 億的多模態嵌入模型中取得領先成績,尤其在 MTEB Code 和 MAEB 上表現突出。768 維全精度結果包括:MTEB 多語言 v2 為 61.36(第一代為 61.15);MTEB Code v1 為 78.68(第一代為 68.76);MIEB lite 影像任務為 64.64;MMEB v2 整體為 59.01;MSEB 聲音檢索為 69.54;MAEB 音訊為 49.39。程式碼檢索提升 9.92 分,約 14%,多語言文本質量保持穩定。不過,規模更大的模型仍在部分榜單上領先,例如 Qwen3-VL-Embedding-2B 在其自測的 MMEB-V2 上報告 73.2,引數量約為 2.7 倍,且不支援音訊。

在端側部署方面,量化後的 EmbeddingGemma 2 在 Pixel 11 Pro 上,純文本權重的活躍記憶體約為 191MB,完整多模態模型約需 567MB。量化感知訓練把權重壓縮為 INT4 和 INT8。Google AI Edge 團隊在 MacBook M5 Pro GPU 上測得每張圖片 37.3 毫秒的處理速度,使用的是 70 token 的視覺預算。Matryoshka 表示學習(MRL)允許開發者把向量截斷到 512、256 或 128 維:從 768 維降到 128 維最多可減少 6 倍儲存;在 256 維時,MTEB 多語言僅從 61.36 微降到 60.41;在 128 維時,MMEB 降至 45.65,因此 Google 建議 128 維主要用於純文本工作負載。

與最接近的競品相比,EmbeddingGemma 2 的定位較為獨特。對比物件包括 EmbeddingGemma 1、Qwen3-VL-Embedding-2B、LCO-Embedding-Omni-3B 和 Gemini Embedding 2。引數規模上分別為 740M(純文本 270M)、308M、2B、3B 骨幹(Hugging Face 頁面標註為 5B)以及未披露。文本和程式碼方面五者均支援;影像和影片方面除第一代外基本都支援;音訊方面 EmbeddingGemma 2 與 LCO 支援,Qwen 不支援,Gemini 支援。輸出維度上,EmbeddingGemma 2 為 768(可截斷至 512、256、128),Gemini 為 3072(128 至 3072),Qwen 最高 2048。上下文長度分別為 8,192、2K、32K、未說明和 8,192 token。語言覆蓋方面前三者與 Gemini 均為 100 多種,Qwen 為 30 多種。許可與訪問方式上,EmbeddingGemma 2、Qwen 和 LCO 均為 Apache 2.0 開放權重,第一代按 Gemma 條款開放,Gemini 僅提供付費 API。公佈端側記憶體的只有 EmbeddingGemma 2(文本約 191MB、全模態約 567MB)和第一代(低於 200MB)。

執行方式上,EmbeddingGemma 2 支援 sentence-transformers v6.1.0 及以上版本、Transformers、vLLM、SGLang、MLX、llama.cpp、Ollama、LM Studio、LiteRT 與 MediaPipe。向量儲存可使用 Qdrant,微調可使用 Unsloth。面向 Android 的 ML Kit 支援及 NPU 加速預計將在數週內推出。典型用法是先安裝支援影像、音訊、影片的 sentence-transformers 與 transformers,然後載入 google/embeddinggemma-2,分別用 SearchQuery 和 Document 提示詞對查詢與文件編碼,再計算相似度。在 Ollama 上可執行 ollama pull embeddinggemma-2,標籤從 270m(378MB)到 740m(1.3GB)不等,演示可在 Google AI Edge Gallery 中檢視。

綜合來看,EmbeddingGemma 2 的要點包括:一個 740M 的開放模型把五種模態嵌入共享的 768 維空間;模組化編碼器讓佔用從 270M 擴充套件到 740M;程式碼檢索從 68.76 躍升至 78.68;量化後在 Pixel 11 Pro 上記憶體佔用介於約 191MB 到 567MB 之間。常見問題方面,該模型可以商用,因為採用 Apache 2.0 許可;記憶體需求則如 Google 所報告,量化後純文本約 191MB,全模態約 567MB。

展開要點與分析

文章情報

工程師進階

要點

  • 單個 740M 模型把文本、程式碼、影像、影片和音訊嵌入共享的 768 維空間,並支援模組化載入,從 270M 純文本到 740M 全模態。
  • MTEB Code 檢索從 68.76 提升至 78.68,多語言文本穩定在 61.36,8K 上下文較上一代擴大 4 倍。
  • 量化後在 Pixel 11 Pro 上純文本約佔用 191MB 記憶體,全模態約 567MB;MRL 可將向量截斷至 512、256 或 128 維。
  • 以 Apache 2.0 開放權重,支援 sentence-transformers、Ollama、llama.cpp、LiteRT 等,Android 端 ML Kit NPU 加速即將推出。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。