Google 发布开源多模态嵌入模型 EmbeddingGemma 2
EmbeddingGemma 2: an open, lightweight multimodal embedding model
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,可将文本、图像、音频和视频映射到统一嵌入空间。
同一新闻,精选展示《Google 发布 EmbeddingGemma 2 多模态嵌入模型并附开发者指南》
2026年10月6日
|
EmbeddingGemma 2 是端侧多模态嵌入能力最强的模型,可将文本、图像、音频和视频的组合原生映射到统一的嵌入空间。
Sahil Dua
Google DeepMind 研究工程师
Henrique Schechter Vera
Google DeepMind 研究工程师
收听文章
[[duration]] 分钟
此内容由 Google AI 生成。生成式 AI 仍处于实验阶段
我们去年推出了 EmbeddingGemma,旨在提供一种轻量级的高质量文本嵌入方案,帮助您的应用直接在消费级硬件上整理、搜索和连接信息。开发者社区的反馈远超我们的预期。下载量已超过 2000 万次,开发者们用它打造了更智能的端侧搜索工具和隐私优先的检索增强生成(RAG)流水线。
今天,我们推出 EmbeddingGemma 2,将能力从文本拓展至在共享嵌入空间中统一代码、图像、视频和音频。EmbeddingGemma 2 基于 Gemma 4 架构构建,采用商业友好的 Apache 2.0 许可证发布,拥有 7.4 亿参数,非常适合端侧推理。它可以从一条语音备忘录中找到特定的视频片段,或根据文本查询搜索数小时的音频录音,这一切都由单个原生多模态模型处理。
EmbeddingGemma 2 采用与 Gemini Embedding 模型相同的技术构建,具备以下特点:
- 同尺寸级别中最佳:在 MTEB(大规模文本嵌入基准)Code 和 MAEB(大规模音频嵌入基准)等基准测试中,于 10 亿参数以下的多模态嵌入模型中取得同类领先成绩,同时在文本、视觉和音频任务上匹配或超越许多更大规模的模型。
- 模块化设计:纯文本工作负载仅需 270M 参数,并可选用视觉(170M)和音频(300M)编码器以实现完整多模态支持。
- 存储高效:借助 Matryoshka 表示学习(MRL),开发者可以将输出向量从 768 维动态截断至 512、256 或 128 维。这为本地向量数据库和内存使用带来最高 6 倍的存储缩减。
- 针对端侧性能优化:可在紧张的资源限制下高效运行。经过量化后,在 Google Pixel 11 Pro 上,EmbeddingGemma 2 的纯文本权重仅需约 191MB 活跃内存,完整多模态模型约需 567MB。
- 支持扩展上下文:具备 8K token 上下文窗口(比 EmbeddingGemma 1 大 4 倍),可直接在本地硬件上处理长达 5.5 分钟的音频、29 张图像、58 个视频帧,或它们的交错组合。
在代码、视觉和音频方面实现顶级质量
EmbeddingGemma 2 延续了 EmbeddingGemma 强大的多语言文本性能,同时在代码性能上实现了 9.92 分的显著提升(MTEB Code 从 68.76 提升至 78.68),非常适合本地代码库索引、语义代码搜索和编程智能体检索。在图像、视频、文档和音频方面,它为 10 亿参数以下的模型树立了单位参数质量的新标准,甚至超越了一些规模超过其两倍的专业模型。
在 EmbeddingGemma 2 模型卡中查看完整评估指标和模型信息。
完全在端侧实现语义搜索、路由和检索
EmbeddingGemma 2 将强大的能力直接带到边缘硬件上。在本地生成嵌入有助于确保数据隐私、降低流水线延迟,并赋能开发者构建完全离线运行的跨模态搜索与检索。
当与 Gemma 4 等生成式模型配合使用时,EmbeddingGemma 2 可实现能够理解复杂多模态数据的端侧 RAG 流水线。由于 EmbeddingGemma 2 构建于 Gemma 4 之上,并共享其文本分词器和音频编码器,开发者可以在统一的流水线中同时运行这两个模型,从而降低合并后的总内存占用。
要了解如何使用 LiteRT 构建端侧搜索与 RAG 系统,请阅读 Google AI Edge 博客文章。
开始使用 EmbeddingGemma 2
我们与以下合作伙伴密切合作,以确保 EmbeddingGemma 2 在您构建的环境中开箱即用:
- 下载模型:在 Hugging Face 和 Kaggle 上查找模型权重,Gemini Enterprise Agent Platform Model Garden 也将很快上线。请访问 Hugging Face 上的 LiteRT 社区 获取针对端侧优化的模型。
- 端侧部署:使用 Google AI Edge MediaPipe 开发跨平台应用,实现开箱即用的嵌入、检索与决策任务,或使用 LiteRT 进行自定义模型集成。使用 transformers.js 或 WebGPU 为浏览器构建应用。
- 使用您喜爱的开发工具:使用 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 高效地提供模型服务。
- 微调:请遵循 Unsloth 的指南,了解如何针对您的用例微调 EmbeddingGemma 2。
来源:Google Blog:AI · blog.google