ChengRang
EN

EmbeddingGemma 2 新增

AI 开发平台 开源
本页为 Gemma 4 的版本 / 子产品详情。查看 Gemma 4 总览 →

Google DeepMind 于 2026 年 10 月发布的多模态嵌入模型,基于 Gemma 4 架构、740M 参数,以 Apache 2.0 许可开放权重。把文本、代码、图像、视频帧和音频映射到同一个嵌入空间,让用文字检索图片或视频这类跨模态查询直接成立,体量也小到可以放进端侧与浏览器场景

嵌入模型 多模态检索 端侧部署 Gemma 开源
访问 EmbeddingGemma 2 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

EmbeddingGemma 2 是 Google DeepMind 在 2026 年 10 月发布的多模态嵌入模型,基于 Gemma 4 架构,740M 参数,以 Apache 2.0 许可开放权重。它的特别之处不在生成什么,而在把什么放进同一个空间:文本、代码、图像、视频帧和音频都被映射到同一个嵌入空间,于是用一句话去检索一段视频、用一张图去找一份文档这类跨模态查询,可以直接用向量距离来算,不需要先做一遍转写或描述。

740M 这个体量是刻意的。它属于 Google AI Edge 这条线,目标是能放进浏览器和端侧设备里跑,让检索这一层不必每次都回到服务器。对做本地知识库、离线搜索、端上 RAG 的人来说,这个尺寸比榜单名次更有意义。

核心功能

适合谁用

以下类型的用户会特别受益于 EmbeddingGemma 2:

优点亮点

价格与方案

权重以 Apache 2.0 许可开放,可免费下载和自行部署,没有调用费用。成本来自你自己的推理资源:端侧运行在用户的设备上,服务端部署则按你选用的机器或推理服务计费。

总结与建议

EmbeddingGemma 2 解决的问题很具体:过去要把不同模态的内容塞进一个可检索的索引,通常得先把图片和音频转写成文字,再按文字检索,中间那一步既慢又会丢信息。把五种模态直接映射到同一个嵌入空间之后,这一步被省掉了,一句提问和一段视频帧之间的距离可以直接算出来。

它值得留意的地方是体量而不是规模。740M 参数意味着它可以待在端上,这对两类场景是决定性的:一类是数据不能出设备的场景,比如本地文档库和手机上的个人资料;另一类是希望检索不产生网络往返的场景,端上跑一次编码比调一次接口更快也更稳。

用之前有两件事要先想清楚。第一,统一嵌入空间的好处建立在合理建索引之上,视频要按帧或按片段抽,音频要分段,这些工程决策比选模型更影响最终效果。第二,Apache 2.0 给了你改的自由,如果你的语料专业度很高,拿自己的数据微调往往比换一个更大的通用模型更划算。

它不适合拿来当通用检测器或者当生成模型用,它只做一件事:把内容变成可以相互比较的向量。这件事做好之后,上面的检索层才有得选。

版本演进

分类
AI 开发平台
价格
开源
标签
嵌入模型 · 多模态检索 · 端侧部署
官网