Perplexity 在嵌入模型赛道再落一子,用一款双尺寸产品同时瞄准边缘部署与高质量索引两个场景。
发生了什么
Perplexity AI 发布了 pplx-embed-v2-late,包含两个规格:一个 0.6B 参数、面向边缘设备运行的轻量模型,以及一个 9B 参数、用于构建高质量索引的大型模型。两个模型均采用 MIT 许可证,支持自托管。在评测中,该系列最高在 MADQA 基准上取得 92.4% 的得分,最低在 ViDoRe v3 Markdown 上为 61.2%。
为什么重要
嵌入模型是检索增强生成(RAG)和语义搜索的底层组件,它决定了系统能否从海量文档中准确召回相关内容。过去,高质量嵌入往往意味着大参数量和高推理成本,而边缘场景则被迫在精度上妥协。Perplexity 此次用同一系列覆盖两端:0.6B 模型让本地设备、浏览器或轻量服务也能跑起可用的嵌入,9B 模型则服务于对召回质量要求苛刻的索引构建。
MIT 许可和自托管能力是另一个关键信号。这意味着企业可以将嵌入模型部署在自有基础设施中,不必将数据发送给第三方 API,这对金融、医疗等敏感行业尤为重要。同时,开源也允许开发者针对垂直领域做进一步微调。
从评测成绩看,92.4% 的 MADQA 得分表明该模型在特定问答检索任务上具备竞争力,而 61.2% 的 ViDoRe v3 Markdown 得分则提示其在视觉文档或 Markdown 结构化内容上的表现仍有提升空间。这种不均衡说明,嵌入模型的能力高度依赖训练数据分布,选型时不能只看单一榜单。
影响与看点
对开发者而言,最直接的价值是选型多了一个开源选项。0.6B 模型适合对延迟和内存敏感的场景,例如移动端离线搜索、浏览器插件或边缘网关;9B 模型则适合在服务器端构建大规模向量索引,配合自托管向量数据库使用。
对企业来说,MIT 许可降低了合规风险,自托管则解决了数据出域的顾虑。但需要注意,9B 模型的推理成本并不低,实际部署时仍需权衡硬件投入与检索质量。
从行业视角看,Perplexity 作为 AI 搜索公司,开源嵌入模型有助于扩大其技术生态影响力,也可能推动嵌入模型市场从 API 调用向自托管迁移。不过,嵌入模型的竞争早已白热化,开源社区已有多个成熟方案,pplx-embed-v2-late 能否脱颖而出,取决于其在真实业务场景中的召回表现和工程友好度。
一个值得关注的判断是:嵌入模型正在从“通用大模型附带能力”演变为“场景专用组件”,双尺寸策略正是这一趋势的体现。未来,针对不同模态和文档类型的专用嵌入模型可能会进一步细分。



