Google 发布开源多模态嵌入模型 EmbeddingGemma 2
先了解这件事
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,基于 Gemma 4 架构,将文本、代码、图像、视频和音频映射到统一的 768 维向量空间。该模型有 740 万参数,以 Apache 2.0 许可发布,Google 称其适合端侧推理;权重已在 Hugging Face 和 Kaggle 提供,Gemini Enterprise Agent Platform Model Garden 将随后上线。 Google DeepMind 称这是其首个原生多模态端侧嵌入开源模型。据 Unsloth 介绍,740M 参数由 270M 文本模型加 170M 视觉编码器和 300M 音频编码器组成,支持 100+ 语言和 8K 上下文,用于语义搜索、RAG 和分类;270M 文本模型最低 0.5GB RAM 运行,完整多模态模型需 1GB RAM,可通过其 GGUF 在本地运行或微调。 使用时可将不用的模态编码器(vision_config 或 audio_config)设为 None 以减少内存占用;视频默认按每秒 1 帧采样,音频需为 16 kHz 单声道。
AI 根据报道生成 · 54 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
- UnslothGoogle 发布开源多模态嵌入模型 EmbeddingGemma 2,本地最低 0.5GB RAM 运行
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,为 Google 首个原生多模态端侧嵌入开源模型,统一文本、代码、图像、音频和视频的共享嵌入空间。模型共 740M 参数,由 270M 文本模型加视觉(170M)和音频(300M)编码器组成,采用 Apache 2.0 许可证,支持 100+ 语言和 8K 上下文,可用于语义搜索、RAG、分类等任务。270M 文本模型最低 0.5GB RAM 即可运行,完整多模态模型需 1GB RAM;可通过 Unsloth 的 GGUF 本地运行或微调,GGUF 地址 https://huggingface.co/unsloth/embeddinggemma-2-GGUF,指南 https://unsloth.ai/docs/models/embeddinggemma-2。
- GoogleGoogle 发布 EmbeddingGemma 2,首个原生多模态端侧嵌入开源模型
Google 发布 EmbeddingGemma 2,是其首个原生多模态开源嵌入模型,基于 Gemma 4 架构并以 Apache 2.0 许可发布。该模型面向端侧嵌入,将图像、视频、音频和代码统一到单一嵌入空间,不再局限于文本。
- Google DeepMindGoogle DeepMind 发布 EmbeddingGemma 2:首个原生多模态端侧嵌入开源模型
Google DeepMind 发布 EmbeddingGemma 2,称其是首个原生多模态的端侧嵌入开源模型。该模型在文本之外统一了代码、图像、音频和视频的共享嵌入空间。
- Google Blog:AI精选Google 发布开源多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,可将文本、图像、音频和视频映射到统一嵌入空间。
- Google Developers Blog精选Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布开源权重多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M。
- Google Developers Blog精选Google 发布 EmbeddingGemma 2 多模态嵌入模型并附开发者指南
Google 发布 Apache 2.0 许可的开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,将文本、代码、图像、视频和音频映射到统一的 768 维向量空间。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。