产品简介
EmbeddingGemma 2 是 Google DeepMind 在 2026 年 10 月发布的多模态嵌入模型,基于 Gemma 4 架构,740M 参数,以 Apache 2.0 许可开放权重。它的特别之处不在生成什么,而在把什么放进同一个空间:文本、代码、图像、视频帧和音频都被映射到同一个嵌入空间,于是用一句话去检索一段视频、用一张图去找一份文档这类跨模态查询,可以直接用向量距离来算,不需要先做一遍转写或描述。
740M 这个体量是刻意的。它属于 Google AI Edge 这条线,目标是能放进浏览器和端侧设备里跑,让检索这一层不必每次都回到服务器。对做本地知识库、离线搜索、端上 RAG 的人来说,这个尺寸比榜单名次更有意义。
核心功能
- 五种模态共用一个空间:文本、代码、图像、视频帧和音频分别编码后落在同一个向量空间里,跨模态的相似度可以直接比较,检索流程不再需要先统一成文字再检索
- 740M 参数的端侧体量:参数量控制在七亿四千万,配合量化可以在浏览器和端侧设备上运行,检索这一层不必依赖服务端往返,离线场景也能成立
- Apache 2.0 开放权重:权重以 Apache 2.0 许可发布,可以商用、可以改、可以自己部署,不受调用配额和供应商限制
- 接着 Gemma 4 的架构:基于 Gemma 4 构建,与同系列的生成模型和 TranslateGemma 处在同一个生态里,工具链和部署方式可以复用
- 嵌在 Google AI Edge 生态里:作为 AI Edge 这条线的成员发布,面向端侧与浏览器场景,和 Google 既有的端上推理工具衔接
- 给检索而不是给生成:输出的是向量不是文字,用法是建索引和做召回:把候选内容编码一次存起来,查询时只编码问题,剩下的交给向量库
适合谁用
以下类型的用户会特别受益于 EmbeddingGemma 2:
- 本地知识库与离线搜索,把文档、截图和会议录音一起建进同一个索引
- 端侧 RAG,让手机或浏览器里的应用在不上传数据的前提下召回自己的资料
- 跨模态素材管理,用文字描述去翻图库和视频片段
- 代码检索,把自然语言问题和代码库放进同一个索引里直接找函数与片段
优点亮点
- 文本、图像、视频、音频和代码落在同一空间,跨模态检索不需要中转
- 740M 的体量让端侧与浏览器部署成为实际选项
- Apache 2.0 许可,商用和自建都没有障碍
- 基于 Gemma 4,与同系列模型和工具链共用一套生态
- 输出的是向量,索引一次之后查询成本很低
- 开放权重意味着可以针对自己的语料做微调,不必受限于通用模型
价格与方案
权重以 Apache 2.0 许可开放,可免费下载和自行部署,没有调用费用。成本来自你自己的推理资源:端侧运行在用户的设备上,服务端部署则按你选用的机器或推理服务计费。
总结与建议
EmbeddingGemma 2 解决的问题很具体:过去要把不同模态的内容塞进一个可检索的索引,通常得先把图片和音频转写成文字,再按文字检索,中间那一步既慢又会丢信息。把五种模态直接映射到同一个嵌入空间之后,这一步被省掉了,一句提问和一段视频帧之间的距离可以直接算出来。
它值得留意的地方是体量而不是规模。740M 参数意味着它可以待在端上,这对两类场景是决定性的:一类是数据不能出设备的场景,比如本地文档库和手机上的个人资料;另一类是希望检索不产生网络往返的场景,端上跑一次编码比调一次接口更快也更稳。
用之前有两件事要先想清楚。第一,统一嵌入空间的好处建立在合理建索引之上,视频要按帧或按片段抽,音频要分段,这些工程决策比选模型更影响最终效果。第二,Apache 2.0 给了你改的自由,如果你的语料专业度很高,拿自己的数据微调往往比换一个更大的通用模型更划算。
它不适合拿来当通用检测器或者当生成模型用,它只做一件事:把内容变成可以相互比较的向量。这件事做好之后,上面的检索层才有得选。
版本演进
- EmbeddingGemma 2 发布 (2026-10-06):Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数的开放权重多模态嵌入模型,以 Apache 2.0 许可发布。它将文本、代码、图像、视频帧和音频映射到同一个嵌入空间,使跨模态检索无需先转写为文本即可直接按向量距离比较;体量面向浏览器与端侧部署,作为 Google AI Edge 生态成员发布