Anthropic 罕见地公开评价一款中国开源模型的能力边界——而它给出的结论,指向的是安全而非性能。

发生了什么

据 The Decoder 报道,Anthropic 表示智谱(Zhipu)的开源权重模型 GLM-5.3 在编写网络漏洞利用(exploit)代码方面的表现,已接近其 Claude Mythos Preview。更值得注意的细节有两个:其一,GLM-5.3 的 Flash 小尺寸变体在智谱 API 定价下,以约 20.40 美元的成本就拼凑出一次可稳定复现的 Chrome 攻击;其二,该模型的安全护栏容易被剥离,去限制版本已在社区中流传。Anthropic 同时承认自身有拉响警报的动机,但美国相关机构 CAISI 的评估为其说法提供了旁证。

为什么重要

这条消息的分量不在“谁更强”,而在能力扩散的速度与形态。

过去两年,业界默认的假设是:真正危险的攻击性能力被锁在少数闭源前沿模型之后,靠 API 风控与使用政策来约束。开源权重模型则被视作“差一档”,能力不足以构成同等威胁。GLM-5.3 的案例正在动摇这个假设——当一个权重可下载、可本地部署、可微调的模型在漏洞利用这一具体任务上逼近闭源前沿,护栏就不再是技术约束,而只是一层可被移除的包装。

成本是另一个变量。20 美元级别即可完成一次针对主流浏览器的可用攻击构造,意味着攻击者的试错预算被压到极低。这并非“AI 自动攻破一切”的科幻叙事,而是把原本需要资深安全研究员数天工作量的环节,压缩成可批量、可并行的廉价流程。

Anthropic 的立场也需要被理性看待。作为闭源阵营的代表,强调开源模型的风险,客观上有利于其主张更严格的模型管控与合规门槛。但 CAISI 的背书说明,这并非纯粹的商业话术,而是有独立评估支撑的判断。

影响与看点

对安全行业而言,防御方的节奏被迫加快。当攻击构造的成本下降到两位数美元,漏洞披露到武器化的窗口期会进一步收窄,依赖人工响应的传统流程将难以匹配。

对开源模型生态而言,这是一次不太舒服的聚光灯。开源权重本身不是问题,但“护栏易剥离 + 权重可自由分发”的组合,会让监管讨论从模型能力转向分发责任。可以预期,围绕权重发布、微调许可与滥用溯源的政策压力会上升,而这对以开放为卖点的厂商构成真实张力。

对开发者来说,值得关注的不是恐慌,而是评估方式的转变:模型能力评测正在从通用基准,转向“在具体高风险任务上能走多远”。这类评测更贴近真实风险,也更难被刷分。

一个独立判断:开源与闭源在攻击性能力上的差距正在收窄,而安全护栏的可移除性,会让“能力管控”这一治理思路越来越难落地——未来的争论焦点,大概率会从模型能不能做,转向谁该为它被做出来负责。