开源嵌入模型的竞争,正在从「单模态、拼参数」转向「多模态、拼统一表示」。
发生了什么
Google DeepMind 发布了 EmbeddingGemma 2,一个约 740M 参数的开源多模态嵌入模型,构建于 Gemma 4 之上,采用 Apache 2.0 许可。据官方信息,它能把五种输入类型映射到同一个 768 维向量空间,并以开放许可形式对外提供。
需要说明的是,目前公开信息集中在模型规模、许可协议、向量维度和输入类型数量这几个关键属性上,具体的评测分数、支持语言、上下文长度和推理成本尚未在现有资料中展开。
为什么重要
嵌入模型是检索增强生成(RAG)、语义搜索、推荐和去重等系统的地基。过去这条链路通常需要为文本、图像、音频等分别维护不同的编码器和索引,工程复杂度高,跨模态检索还要额外做对齐。EmbeddingGemma 2 的核心主张,是把多种输入类型收进同一个向量空间——这意味着文本查图片、图片查文本这类跨模态检索,可以用一套索引、一次近邻搜索完成。
另一个信号是「开放」。Apache 2.0 允许商用与二次分发,对不愿意把数据送到闭源嵌入 API 的团队来说,这是一个可自托管的选项。而选择在 Gemma 4 之上构建,也说明 Google 正在把 Gemma 系列当作一个可复用的底座,而非单一模型,嵌入能力被纳入同一技术谱系。
740M 这个量级同样值得注意:它明显小于动辄数十亿参数的多模态大模型,目标显然是能在单卡甚至边缘侧部署,而不是追求榜单上的绝对最优。
影响与看点
对开发者而言,最直接的变化是检索架构可以简化。如果五种输入确实共享一个 768 维空间,那么向量库的 schema、索引策略和召回逻辑都能统一,跨模态应用的开发成本会下降。
对行业而言,这延续了 2024 年以来开源嵌入模型的密集迭代节奏,也把竞争焦点从「谁的文本检索更强」推向「谁能用一套表示覆盖更多模态」。闭源嵌入 API 的护城河,正在被开放权重和自托管能力持续侵蚀。
真正需要观察的有三点:一是跨模态检索的实际召回质量,统一空间是否以牺牲单模态精度为代价;二是 768 维在长文档和大规模图库上的表现是否够用;三是 Apache 2.0 之下,社区能否围绕它快速形成工具链和微调生态。
一句话判断:EmbeddingGemma 2 的价值不在于参数规模,而在于它把「多模态统一表示」从研究议题推向了可直接部署的开源基础设施。


