跳到主要内容
AI News HubLIVE
站内改写3 分钟阅读

Google DeepMind 发布 EmbeddingGemma 2:基于 Gemma 4 的 740M 开源多模态嵌入模型

文章摘要

Google DeepMind 推出 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到同一个 768 维向量空间。该模型拥有 740M 参数、8K token 上下文窗口,并以 Apache 2.0 许可开放权重,面向端侧搜索、分类和隐私优先的 RAG。权重已在 Hugging Face 与 Kaggle 上线,同时提供 Ollama、llama.cpp GGUF 和 LiteRT 版本,可立即部署。

来源MarkTechPost作者: Asif Razzaq
Google DeepMind 发布 EmbeddingGemma 2:基于 Gemma 4 的 740M 开源多模态嵌入模型
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

Google DeepMind 正式发布 EmbeddingGemma 2,这是一款开放的多模态嵌入模型,可将文本、代码、图像、视频和音频统一映射到同一个 768 维向量空间。该模型拥有 740M 参数、8,192 token 的上下文窗口,采用 Apache 2.0 许可,主要面向端侧搜索、分类以及隐私优先的 RAG 场景。目前权重已在 Hugging Face 和 Kaggle 上线,并同步提供 Ollama、llama.cpp GGUF 与 LiteRT 构建版本,开发者可以立即部署使用。

嵌入模型的作用是把内容转换成能够表达含义的数字向量,语义相近的内容在向量空间中彼此靠近,因此便于检索和比较。在 RAG 流程中,这些向量让大语言模型能够取回训练数据之外的最新信息。在本地生成嵌入可以让数据保留在设备上,同时降低延迟并支持离线运行。

EmbeddingGemma 2 基于 Gemma 4 架构,设计高度模块化,由三个部分组成:文本与代码骨干网络为 270M 参数(其中 130M 为 transformer、140M 为 embedder);视觉编码器为 170M 参数,可选加载;音频编码器为 300M 参数,同样可选。开发者可以按需组合,纯文本只需 270M,文本加视觉为 440M,文本加音频为 570M,全部模态则为 740M,而且所有配置共享同一个向量空间——用纯文本配置生成的查询向量,可以直接匹配由完整模型嵌入的文档。模型支持跨模态检索,例如用文字查询检索照片,或用语音备忘录检索视频片段;像同时包含文字、图片和演示视频的商品页面这样的交错输入,也会生成单一嵌入。上下文窗口为 8,192 token,相比第一代扩大 4 倍,约可容纳 29 张图片、58 帧视频或 5.5 分钟音频。

在基准测试方面,Google 研究团队称该模型在参数低于 10 亿的多模态嵌入模型中取得领先成绩,尤其在 MTEB Code 和 MAEB 上表现突出。768 维全精度结果包括:MTEB 多语言 v2 为 61.36(第一代为 61.15);MTEB Code v1 为 78.68(第一代为 68.76);MIEB lite 图像任务为 64.64;MMEB v2 整体为 59.01;MSEB 声音检索为 69.54;MAEB 音频为 49.39。代码检索提升 9.92 分,约 14%,多语言文本质量保持稳定。不过,规模更大的模型仍在部分榜单上领先,例如 Qwen3-VL-Embedding-2B 在其自测的 MMEB-V2 上报告 73.2,参数量约为 2.7 倍,且不支持音频。

在端侧部署方面,量化后的 EmbeddingGemma 2 在 Pixel 11 Pro 上,纯文本权重的活跃内存约为 191MB,完整多模态模型约需 567MB。量化感知训练把权重压缩为 INT4 和 INT8。Google AI Edge 团队在 MacBook M5 Pro GPU 上测得每张图片 37.3 毫秒的处理速度,使用的是 70 token 的视觉预算。Matryoshka 表示学习(MRL)允许开发者把向量截断到 512、256 或 128 维:从 768 维降到 128 维最多可减少 6 倍存储;在 256 维时,MTEB 多语言仅从 61.36 微降到 60.41;在 128 维时,MMEB 降至 45.65,因此 Google 建议 128 维主要用于纯文本工作负载。

与最接近的竞品相比,EmbeddingGemma 2 的定位较为独特。对比对象包括 EmbeddingGemma 1、Qwen3-VL-Embedding-2B、LCO-Embedding-Omni-3B 和 Gemini Embedding 2。参数规模上分别为 740M(纯文本 270M)、308M、2B、3B 骨干(Hugging Face 页面标注为 5B)以及未披露。文本和代码方面五者均支持;图像和视频方面除第一代外基本都支持;音频方面 EmbeddingGemma 2 与 LCO 支持,Qwen 不支持,Gemini 支持。输出维度上,EmbeddingGemma 2 为 768(可截断至 512、256、128),Gemini 为 3072(128 至 3072),Qwen 最高 2048。上下文长度分别为 8,192、2K、32K、未说明和 8,192 token。语言覆盖方面前三者与 Gemini 均为 100 多种,Qwen 为 30 多种。许可与访问方式上,EmbeddingGemma 2、Qwen 和 LCO 均为 Apache 2.0 开放权重,第一代按 Gemma 条款开放,Gemini 仅提供付费 API。公布端侧内存的只有 EmbeddingGemma 2(文本约 191MB、全模态约 567MB)和第一代(低于 200MB)。

运行方式上,EmbeddingGemma 2 支持 sentence-transformers v6.1.0 及以上版本、Transformers、vLLM、SGLang、MLX、llama.cpp、Ollama、LM Studio、LiteRT 与 MediaPipe。向量存储可使用 Qdrant,微调可使用 Unsloth。面向 Android 的 ML Kit 支持及 NPU 加速预计将在数周内推出。典型用法是先安装支持图像、音频、视频的 sentence-transformers 与 transformers,然后加载 google/embeddinggemma-2,分别用 SearchQuery 和 Document 提示词对查询与文档编码,再计算相似度。在 Ollama 上可执行 ollama pull embeddinggemma-2,标签从 270m(378MB)到 740m(1.3GB)不等,演示可在 Google AI Edge Gallery 中查看。

综合来看,EmbeddingGemma 2 的要点包括:一个 740M 的开放模型把五种模态嵌入共享的 768 维空间;模块化编码器让占用从 270M 扩展到 740M;代码检索从 68.76 跃升至 78.68;量化后在 Pixel 11 Pro 上内存占用介于约 191MB 到 567MB 之间。常见问题方面,该模型可以商用,因为采用 Apache 2.0 许可;内存需求则如 Google 所报告,量化后纯文本约 191MB,全模态约 567MB。

展开要点与分析

文章情报

工程师进阶

要点

  • 单个 740M 模型把文本、代码、图像、视频和音频嵌入共享的 768 维空间,并支持模块化加载,从 270M 纯文本到 740M 全模态。
  • MTEB Code 检索从 68.76 提升至 78.68,多语言文本稳定在 61.36,8K 上下文较上一代扩大 4 倍。
  • 量化后在 Pixel 11 Pro 上纯文本约占用 191MB 内存,全模态约 567MB;MRL 可将向量截断至 512、256 或 128 维。
  • 以 Apache 2.0 开放权重,支持 sentence-transformers、Ollama、llama.cpp、LiteRT 等,Android 端 ML Kit NPU 加速即将推出。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。