开源权重模型正在快速逼近闭源前沿模型的性能,但安全防护的缺口却未见收窄。SaferAI的一份新报告显示,Z.ai的GLM-5.2模型在多项基准上接近前沿水平,却缺少关键的安全缓解措施,这再次将开源模型的治理问题推至台前。

发生了什么

根据SaferAI发布的报告,Z.ai的开源权重模型GLM-5.2在性能上已接近当前最先进的闭源模型,但在安全防护方面存在显著缺失。报告指出,该模型缺乏若干关键的安全缓解措施,例如对有害内容生成的过滤机制、滥用检测功能以及细粒度的使用限制。这意味着,尽管模型能力强大,但它在面对恶意使用时可能缺乏足够的防御。

为什么重要

这一发现并非孤例。近年来,开源权重模型(如Llama系列、Mistral等)的能力持续提升,逐渐缩小了与闭源模型(如GPT-4、Claude等)的差距。然而,安全防护的进展却相对滞后。闭源模型通常通过API提供,供应商可以实施集中式的安全策略、监控和快速更新;而开源模型一旦发布,便无法追溯控制,其安全防护完全依赖开发者自觉和社区监督。

GLM-5.2的案例表明,即使模型性能接近前沿,安全措施仍可能停留在“基础”水平。这加剧了业界的担忧:当开源模型的能力足以被滥用时,现有的治理框架是否还能跟上?SaferAI的报告并非要否定开源模型的价值,而是提醒我们,能力与安全之间的失衡可能带来新的风险。

影响与看点

对于开发者而言,选择开源模型时,除了关注性能指标,更应评估其安全防护的完整性。对于平台方和监管者,这一报告再次凸显了制定开源模型安全标准的紧迫性。值得关注的是,未来是否会出现类似“安全评分”的第三方评估体系,帮助用户做出更明智的决策。

从行业趋势看,开源模型的能力提升不可逆转,但安全差距的弥补需要多方努力:模型开发者应在训练阶段就嵌入安全对齐,社区应建立更有效的漏洞报告和响应机制,而监管机构则需明确开源模型的合规要求。

一个可能的判断是:开源模型的安全问题不会自动解决,它需要像性能竞赛一样被认真对待。否则,我们可能迎来一个能力强大但缺乏防护的“蛮力”时代。