跳到正文
原文
Reddit · r/LocalLLaMA· /u/FinancialAd1961·· 21 小时前AI 评分27

EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行

Image-text retrieval with EmbeddingGemma 2's vision tower, running in the browser on WebGPU

AI 导读

EmbeddingGemma 2 将图像和文本映射到同一个 768 维向量空间,支持以文字描述检索图片。开发者将其文本塔与视觉塔移植到 TypeScript 写的 WebGPU 推理库 ruNNtime,并在浏览器中用本地 GPU 完成完整检索流程,原始数据无需上传服务器。ruNNtime 同时兼容多种类视觉模型,可在交互式文档里直接体验。

来源:Reddit · r/LocalLLaMA · reddit.com