企业级 AI 平台 Databricks 在自家代码库上对编码智能体进行基准测试后,决定将中国开源模型 GLM 5.2 作为默认编码引擎。该模型在性能上与 Anthropic 的 Opus 4.8 持平,但成本更低。

发生了什么

Databricks 在拥有数百万行代码的内部代码库上,对多个编码智能体进行了基准测试。结果显示,智谱 AI 的开源模型 GLM 5.2 在编码任务上达到了与 Anthropic Opus 4.8 相当的水平,而每任务成本仅为 1.28 美元,低于 Opus 的 1.94 美元。基于此,Databricks 计划将 GLM 5.2 作为日常编码工作的主力模型进行推广。

为什么重要

这一决策凸显了开源模型在企业级应用中的竞争力。GLM 5.2 作为中国团队开发的开源模型,能够在编码任务上比肩业界领先的闭源模型,且成本优势明显。更重要的是,Databricks 的测试基于其真实、复杂的代码库,而非公开的标准化基准,这为模型的实际表现提供了更有说服力的证据。此外,Databricks 强调,没有任何单一供应商能够主导所有场景,企业应构建自己的基准测试,而不是依赖公开榜单。

影响与看点

对于开发者而言,GLM 5.2 的开源特性意味着更低的部署成本和更高的定制灵活性。对于企业,这一案例表明,在特定任务上,开源模型可能比闭源模型更具性价比。值得关注的是,Databricks 的测试方法论——使用内部代码库进行评测——可能成为行业趋势,推动更多企业建立自己的评估体系。此外,GLM 5.2 的成功也可能加速中国开源模型在全球企业中的采用。