Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2
Bring multimodal semantic search to the edge with EmbeddingGemma 2
Google DeepMind 发布开源权重多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M。
原文给出参数量、内存占用和各设备实测延迟,读者可以据此评估端侧多模态检索的落地成本。
2026年10月6日
今天,Google DeepMind 推出了 EmbeddingGemma 2,这是一款在其规模下表现一流、开放权重、多模态的嵌入模型,可原生地将文本、图像、视频帧和音频映射到单一统一的向量空间中。对于构建本地搜索和媒体检索体验的开发者来说,它降低了将独立的图像描述、语音转文本和文本嵌入模型串联起来所带来的延迟和内存开销。EmbeddingGemma 2 专为本地、隐私优先的应用而设计,以紧凑的 7.4 亿参数规模覆盖文本、视觉和音频模态,提供模块化编码器,在 Google Pixel 11 Pro 上,纯文本权重仅需约 191MB 活动内存即可运行,完整的全模态模型则需约 567MB。最值得一提的是,EmbeddingGemma 2 可作为超低延迟的端侧决策引擎。它无需任何训练数据或微调,即可将用户输入直接与分类标签和描述进行匹配,在几毫秒内实现即时、零样本的意图路由。如需了解模型架构和评估(包括多模态嵌入能力)的概览,请查看 Google DeepMind 博客。
在本文中,我们将分享如何通过 Google AI Edge 的互动展示、移动端的 Google AI Edge Gallery 和 Mac 上的 Google AI Edge Foresight 立即体验 EmbeddingGemma 2 的强大功能,以及如何利用该模型构建你自己的私密、端侧语义搜索、视觉关键帧检索和条件触发工作流。在接下来的几周内,我们还将把该模型作为 Android 上的服务提供,可通过 ML Kit 访问,包括使用 NPU 加速以进一步优化各类设备上的性能。
Google AI Edge Gallery 是一款跨平台展示应用,旨在让用户和开发者在实际场景中体验和评估端侧 AI 模型及其能力。今天,我们在 Google AI Edge Gallery 应用中新增了两个由 EmbeddingGemma 2 驱动的互动展示:Instant Media Search 和 Video Moments Finder。
Instant Media Search 允许用户使用自然语言或示例图像在本地媒体中查找特定的图片或视频。通过将输入查询和媒体都转换为端侧嵌入向量——后者存储在本地 SQLite 数据库中——系统通过返回余弦相似度最大的内容来检索相关内容。这使得用户输入时即可获得即时、交互式的搜索体验。
抱歉,你的浏览器不支持此视频的播放
边输入边搜索与图像到图像的检索
- 端侧图像嵌入计算与快速多模态检索:无论你是从应用提供的示例图像集开始,还是在自己的媒体上测试即时搜索,你都可以体验到 EmbeddingGemma 2 在你的手机上本地执行嵌入计算的速度有多快,无需互联网连接。
- 多模态检索与相似度匹配:由于查询 token 嵌入和余弦相似度排序通过 MediaPipe UniversalEmbedder 和 SemanticRetriever 在设备上快速执行,搜索结果会在每次按键时实时更新。当你输入“Katze”(德语中的“猫”)时,网格会立即显示你收藏中的所有猫科动物照片;继续输入“Katze schläft auf Tastatur”(德语中的“猫睡在键盘上”)会动态重新排序,并实时将你心中所想的那张特定照片置顶。除了支持多种语言的文本查询外,用户还可以从手机中选择任意图像,或使用实时摄像头画面来检索视觉和语义相关的照片。
视频瞬间查找器展示了 EmbeddingGemma 2 的跨模态表示能力的另一个应用示例,使用户无需转录音频或生成中间文本字幕,即可在本地视频录像中定位特定的视觉瞬间。
抱歉,你的浏览器不支持播放此视频
在本地视频文件中搜索特定瞬间
- 设备端视频关键帧索引与自然语言搜索:用户选择本地视频(如家庭视频或体育集锦)后,设备端引擎会对视觉和音频片段建立索引,并为其生成嵌入。当用户输入描述性查询时,例如“孩子们在笑”、“狗接飞盘”或“人吹灭生日蜡烛”,引擎会计算提示嵌入向量,将其与视频帧嵌入进行比较,并立即高亮显示匹配瞬间所在的精确时间戳。
从 Google Play 商店或 Apple App Store 下载最新版本的 Google AI Edge Gallery 应用,试用这些新演示。查看 Github 仓库了解其实现方式,并开始使用 EmbeddingGemma 2 构建你自己的体验。
Mac 版 Google AI Edge Foresight 中的生产力提升与上下文检索
我们很高兴地宣布推出 Mac 版 Google AI Edge Foresight,这是一款实验性应用,可将上下文感知的会议助手直接带到你的设备上。Foresight 由完全本地的 AI 处理提供支持,可无缝协助你记笔记、建立索引,并回忆对话记录和私人文件。通过直接与你的系统音频和麦克风集成,它开箱即用,适用于任何会议平台,甚至完全离线也能使用。
抱歉,你的浏览器不支持播放此视频
自动增强速记笔记
抱歉,你的浏览器不支持播放此视频
AI 实时检测并回答问题
由 EmbeddingGemma 2 和 Gemma 4 模型提供支持,Foresight 提供:
- 增强笔记:使用从当前会议对话中实时检索到的详细信息来丰富手动速记笔记。
- 跨模态检索:使用自然语言轻松查找不同类型的媒体(图像、文档、转录文本和笔记)。
- 设备端优势:你的敏感信息保持安全,同时无论网络连接如何都能保持不间断的生产力,并且无需云订阅费用。
通过将文本、音频和视觉数据映射到单一向量空间,Foresight 可在你的个人知识库中运行本地、安全的搜索。无论你是在会议中实时回答问题,还是撰写详尽的笔记,你所需的细节始终触手可及,而你的敏感数据绝不会离开你的设备。
立即下载Google AI Edge Foresight Mac 应用,为你的每一次会议带来智能的本地伙伴。
使用 ML Kit 为 Android 构建
对于面向 Android 生态系统的开发者,EmbeddingGemma 2 是一个轻量级、任务专用的模型,非常适合在设备上执行。我们将在未来几周内将这些统一搜索能力引入 ML Kit,为未来的生产级 Android 应用提供标准化、平台集成的路径。通过与 ML Kit 集成,开发者可以开箱即用获得生产级质量的 EmbeddingGemma,无需管理模型,也无需担心 APK 臃肿。ML Kit 将通过 NPU 加速(在可用时)和自动模型更新,带来极速的性能。
使用 MediaPipe Tasks 进行跨平台构建
集成类似上述 Google AI Edge Gallery 和 Foresight 中的本地搜索功能,通常需要开发者处理底层媒体预处理,以便将数据输入嵌入模型。为简化这一过程,MediaPipe Tasks 正在为现有的 Embedder 和 Semantic Retriever 添加对 EmbeddingGemma 2 的支持;这是我们当前 RAG SDK 的新接口。
无论你的目标是 iOS、macOS、Windows、Linux 还是 Web,MediaPipe Tasks 都提供统一的开发者体验,让你一次编写、跨所有平台部署。Embedder 和 Semantic Retriever Tasks 无需开发者手动管理预处理和数据转换,而是提供了一套完全抽象这些步骤的即用型解决方案。
- MediaPipe Universal Embedder Task:自动处理图像缩放、张量归一化和多模态分词。直接传入原始图像或文本字符串,即可获得 768 维(或截断的 128d–512d)归一化向量,无需任何样板代码。
- MediaPipe Semantic Retriever Task:一个边缘优化的嵌入式向量搜索引擎,可在设备上索引嵌入并运行快速的近似最近邻(ANN)搜索,在个位数毫秒内返回排序后的匹配结果。
EmbeddingGemma 2 还可与 MediaPipe Decision Task 一起用作多模态、实时决策引擎。这使开发者能够轻松对图像、文本或音频输入进行分类,无需微调,并在设备上即时做出决策,从而实现路由或动作预测等用例。下面的示例展示了 MediaPipe Decision 任务在棋局中每回合评估 500 个选项时运行响应时间低于 100 毫秒,展示了 EmbeddingGemma 2 作为完全在设备上运行的决策引擎的效率。
抱歉,你的浏览器不支持播放此视频
EmbeddingGemma 2 在设备上驱动低延迟的 MediaPipe Decision 任务
使用 LiteRT 和 EmbeddingGemma 2 构建跨平台应用
虽然 MediaPipe Tasks 提供了开箱即用的简洁性,但需要对处理和加速进行细粒度控制的跨平台应用,可以直接构建在 LiteRT——这一久经验证的引擎之上,它驱动着 ML Kit、MediaPipe Tasks、Google AI Edge Gallery 和 Foresight。依托跨 CPU、GPU 和 NPU 的统一加速,部署被极大简化并具备出色的可移植性:单个 .litertlm 文件即可在所有受支持的边缘平台上开箱即用地在 CPU 和 GPU 上运行。
在 Android 上,ML Kit API(即将推出)利用 LiteRT 为该平台提供优化的实现,让你同时获得性能与简洁性,而无需担心模型生命周期管理。
为了给 EmbeddingGemma 2 提供最佳推理速度,我们针对视觉编码等计算密集型工作负载实施了有针对性的优化。这解锁了高度响应、实时的 AI 体验,例如 Google AI Edge Gallery 应用中的“输入即搜索”,在 MacBook M5 Pro GPU 上视觉嵌入耗时低至 37.3 ms(每秒 26.9 张图像)。更多测量数据见表格。

表格:在一组代表性设备上,EmbeddingGemma 2 每张图像的视觉延迟(跨 CPU、GPU 和 NPU)。延迟列表示视觉嵌入延迟,评估时每张图像最多使用 70 个视觉 token。
底层架构优化
在内存受限的边缘设备上实现 EmbeddingGemma 2 的高性能执行,得益于以下优化:
- 跨模态的模块化: 仅加载你需要的编码器(例如,用于照片和视频搜索的文本 + 视觉编码器,或在添加语音备忘录时动态激活音频编码器),以最大化边缘效率并管理系统内存压力。
- 量化感知训练(QAT): 将模型权重压缩至 INT4 和 INT8,使多模态向量搜索进入中端消费级硬件的可及范围。
- 自适应输入与输出缩放:给定文本和图像输入大小,我们在运行时动态加载最优计算图,并在所有 CPU、GPU 和 NPU 后端上一致支持。这一设计可适应可变文本长度而不浪费计算,同时让开发者能够控制视觉 token 预算,以在延迟与精度之间取得理想平衡。在输出方面,内置的俄罗斯套娃表示学习(MRL)切片支持即时维度截断,将本地存储和索引占用减少最多 8 倍。
LiteRT 在广泛的边缘设备和网页(WASM)上提供稳健的跨平台性能。有关受支持硬件平台的完整列表和最新性能基准,请参阅我们的 Hugging Face 模型卡。你可以在 Google Cloud 上使用 LiteRT 基准测试工具和更多实体设备,或查看我们的零配置网页演示,即刻在浏览器中体验。
立即开始
EmbeddingGemma 2 和 Google AI Edge 提供了构建模块,可将快速、私密且离线的多模态检索直接带入你的应用。无论你是在试验即时图像搜索、视觉关键帧检索还是环境条件触发,你所需的所有工具如今都已可用。
- 体验 EmbeddingGemma 2 演示:通过 Google AI Edge Gallery 应用在 Android 和 iOS 上,在您自己的设备上试用 即时媒体搜索 和 视频片段查找器,并使用 AI Edge Foresight 查看个人知识库检索的实际运行效果。
- 基准测试 EmbeddingGemma 2:在 Google Cloud 的 Developer Device Platform 中,跨 200 多台不同的真实物理设备,使用 EmbeddingGemma 2 对功能进行基准测试和开发。从 Github 上我们交互式的 Google Colab 和指南开始。
- 部署 EmbeddingGemma 2:直接从 Hugging Face LiteRT 社区下载可直接运行、预量化的
.litertlm包。 - 开始构建:探索 MediaPipe Tasks 以获取开箱即用的集成,或按照 LiteRT-LM 开发者指南进行更多自定义实现。探索 Google AI Edge Gallery 应用中的参考实现。
致谢
我们要特别感谢我们的 重要贡献者为本项目所做的工作:
Abhishek Jatram, Aditya Srivastava, Akshat Sharma, Alexander Kanaukou, Alice Zheng, Ami Kubota, Ander Dobo, Andrew Zhang, Brad Lassey, Chandramouli Amarnath, Chanchal Raj, Charlie Xu, Chenchen Tang, Chirag Gupta, Chintan Parikh, Cormac Brick, David Chou,Debapriya Maji, Denis Daletski, Fengwu Yao, Florian Kübler, Geonsun Lee,, Gregory Karpiak, Himangshu Roy, Henrique Schechter Vera, Hriday Chhabria, Ian Ballantyne,Ivan Llanos Jae Yoo, Jenn Lee, Jianing Wei, Jing Jin, Jingjiang Li, Jingtao Zhou, Jingxiao Zheng, Juhyun Lee, Julius Kammerl, Karthik Thirumalai, Kat Black, Kristen Quan, Kristen Wright, Lu Wang, Lutz Justen, Malini PV, Marissa Ikonomidis, Matthew Chan, Matthew Soulanille, Matthias Grundmann, Mogan Shieh, Na Li, Naina Singla, Olivier Lacombe, Priya Patel, Qidong Zhao, Queenie Zhang, Renjie Wu, Rishika Sinha, Rishubh Khurana, Ronald Wotzlaw, Sachin Kotwani, Sandeep Patil, Sebastian Russo, Sebastian Schmidt, Shengyi Lin, Shuangfeng Li, Steven Toribio, Suril Shah, Sylvain Vignaud, Somdatta Banerjee, Tenghui Zhu, Vinod Mamillapalli, Vladimir Kirilyuk, Wai Hon Law, Weiyi Wang, Xiaoming Hu, Xinan Cheng, Xu Chen, Yi-Chun Kuo, Yishuang Pang, Yu-hui Chen.
上一页
下一页
来源:Google Developers Blog · developers.googleblog.com