Google DeepMind 开源端侧多模态嵌入模型 EmbeddingGemma 2
先了解这件事
2026 年 10 月 6 日晚,Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,面向端侧运行。该模型基于 Gemma 4 架构,采用 Apache 2.0 协议开源,总参数量 740M,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间,支持 RAG、检索、分类与聚类等本地应用。后续报道披露其内部组成:270M 文本模型与 170M 视觉编码器、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件的低延迟语义表示设计。Google 称在多模态嵌入基准上其表现优于尺寸达两倍的竞品,是同档中最紧凑的模型;在 Massive Text Embedding Benchmark (Code) 上得分 78.68,较前代提升近 10 分。10 月 7 日凌晨,Google DeepMind 官方确认上述信息。10 月 7 日下午,开发者社区将 EmbeddingGemma 2 的文本塔与视觉塔移植到基于 TypeScript 的 WebGPU 推理库 ruNNtime,实现了图像-文本检索的浏览器端纯本地推理,原始数据无需上传服务器。
AI 根据报道生成 · 20 小时前更新
事件进展
- 10月7日 17:26 · 1 篇报道EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行Reddit · r/LocalLLaMA:EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行
- 10月6日 23:41 · 6 篇报道Google发布EmbeddingGemma 2多模态嵌入模型Google DeepMind:Google DeepMind 发布端侧多模态嵌入模型 EmbeddingGemma 2
报道时间线
沿着报道,了解事件的不同侧面。
- Reddit · r/LocalLLaMAEmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行
EmbeddingGemma 2 将图像和文本映射到同一个 768 维向量空间,支持以文字描述检索图片。开发者将其文本塔与视觉塔移植到 TypeScript 写的 WebGPU 推理库 ruNNtime,并在浏览器中用本地 GPU 完成完整检索流程,原始数据无需上传服务器。ruNNtime 同时兼容多种类视觉模型,可在交互式文档里直接体验。
- Hacker News · 首页Google EmbeddingGemma 2 发布
Google 推出 EmbeddingGemma 2 嵌入向量模型。由于原文未提供具体细节,无法进一步展开参数规模、上下文长度或基准测试分数等信息。
- Google DeepMindGoogle DeepMind 发布端侧多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 推出 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数量为 740M,可将文本、图像、音频和视频映射到统一嵌入空间。
- The DecoderGoogle 发布开源多模态嵌入模型 EmbeddingGemma 2,主打端侧运行
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量为 740M,可将文本、图像、视频、音频和代码转为向量。Google 称在多模态嵌入基准上它优于尺寸达其两倍的竞品,是同档中最紧凑的模型;在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代提升近 10 分。
- Reddit · r/LocalLLaMAGoogle DeepMind 开源多模态嵌入模型 EmbeddingGemma 2,可在消费级硬件端侧运行
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间。模型共 740M 参数,由 270M 文本模型与 170M 视觉、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件上的低延迟语义表示设计,支持搜索、RAG、分类与聚类等端侧应用。
- Hacker News · 首页Google DeepMind 发布开源端侧多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议,参数 740M,面向文本、图像、音频、视频的统一多模态嵌入。
- Reddit · r/LocalLLaMAEmbeddingGemma 2:Google DeepMind 开源多模态嵌入模型
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,总参数量 740M,可将文本(含代码)、图像、视频和音频统一映射到 768 维向量空间,支持 RAG、检索、分类与聚类等本地应用。
本事件热度走势
当前热度 17·可比范围峰值 37(10月7日 06:00)·近 24 小时可比范围变化 -43%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。