跳到正文
热点事件持续更新

Google DeepMind 开源端侧多模态嵌入模型 EmbeddingGemma 2

7 篇报道4 个报道来源21 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日晚,Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,面向端侧运行。该模型基于 Gemma 4 架构,采用 Apache 2.0 协议开源,总参数量 740M,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间,支持 RAG、检索、分类与聚类等本地应用。后续报道披露其内部组成:270M 文本模型与 170M 视觉编码器、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件的低延迟语义表示设计。Google 称在多模态嵌入基准上其表现优于尺寸达两倍的竞品,是同档中最紧凑的模型;在 Massive Text Embedding Benchmark (Code) 上得分 78.68,较前代提升近 10 分。10 月 7 日凌晨,Google DeepMind 官方确认上述信息。10 月 7 日下午,开发者社区将 EmbeddingGemma 2 的文本塔与视觉塔移植到基于 TypeScript 的 WebGPU 推理库 ruNNtime,实现了图像-文本检索的浏览器端纯本地推理,原始数据无需上传服务器。

AI 根据报道生成 · 20 小时前更新

事件进展

2 个进展
  1. 10月7日 17:26 · 1 篇报道
    EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行
    Reddit · r/LocalLLaMA:EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行
  2. 10月6日 23:41 · 6 篇报道
    Google发布EmbeddingGemma 2多模态嵌入模型
    Google DeepMind:Google DeepMind 发布端侧多模态嵌入模型 EmbeddingGemma 2

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. Reddit · r/LocalLLaMA
    EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行

    EmbeddingGemma 2 将图像和文本映射到同一个 768 维向量空间,支持以文字描述检索图片。开发者将其文本塔与视觉塔移植到 TypeScript 写的 WebGPU 推理库 ruNNtime,并在浏览器中用本地 GPU 完成完整检索流程,原始数据无需上传服务器。ruNNtime 同时兼容多种类视觉模型,可在交互式文档里直接体验。

  2. Hacker News · 首页
    Google EmbeddingGemma 2 发布

    Google 推出 EmbeddingGemma 2 嵌入向量模型。由于原文未提供具体细节,无法进一步展开参数规模、上下文长度或基准测试分数等信息。

  3. Google DeepMind
    Google DeepMind 发布端侧多模态嵌入模型 EmbeddingGemma 2

    Google DeepMind 推出 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数量为 740M,可将文本、图像、音频和视频映射到统一嵌入空间。

  4. The Decoder
    Google 发布开源多模态嵌入模型 EmbeddingGemma 2,主打端侧运行

    Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量为 740M,可将文本、图像、视频、音频和代码转为向量。Google 称在多模态嵌入基准上它优于尺寸达其两倍的竞品,是同档中最紧凑的模型;在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代提升近 10 分。

  5. Reddit · r/LocalLLaMA
    Google DeepMind 开源多模态嵌入模型 EmbeddingGemma 2,可在消费级硬件端侧运行

    Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间。模型共 740M 参数,由 270M 文本模型与 170M 视觉、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件上的低延迟语义表示设计,支持搜索、RAG、分类与聚类等端侧应用。

  6. Hacker News · 首页
    Google DeepMind 发布开源端侧多模态嵌入模型 EmbeddingGemma 2

    Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议,参数 740M,面向文本、图像、音频、视频的统一多模态嵌入。

10月6日
  1. Reddit · r/LocalLLaMA
    EmbeddingGemma 2:Google DeepMind 开源多模态嵌入模型

    Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,总参数量 740M,可将文本(含代码)、图像、视频和音频统一映射到 768 维向量空间,支持 RAG、检索、分类与聚类等本地应用。

本事件热度走势

当前热度 17·可比范围峰值 37(10月7日 06:00)·近 24 小时可比范围变化 -43%

01020304010月7日00:0010月7日13:0010月8日01:0010月8日14:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。