当模型能力逼近甚至越过现有监管与内部评测的边界,由谁来判断它是否安全,正在成为比模型本身更难回答的问题。

发生了什么

OpenAI 发布了一份关于第三方评估的立场文件,主题是前沿模型的有效第三方评估应遵循的优先级与原则。从公开摘要看,其核心主张有三层:评估要严谨(rigorous)、要安全(secure)、要独立(independent),覆盖对象既包括前沿模型本身,也包括围绕模型部署的防护措施(safeguards)。也就是说,OpenAI 讨论的不只是“测模型”,还包括对安全机制本身的外部检验。

为什么重要

前沿模型的评测长期存在一个结构性矛盾:最有能力做深度评测的机构,往往也是被评测模型的开发者。内部红队、内部基准、内部发布门槛,本质上都是自证。随着各国监管开始把“独立评估”写进合规要求,第三方评估从可选项变成了必答题。

但第三方评估并不天然可信。它面临三个现实难题:一是能力问题,外部机构能否拿到足够的模型访问权限、复现训练与部署环境;二是安全问题,评估过程本身可能泄露权重、提示词或攻击手法,甚至成为能力扩散的通道;三是独立性问题,评估机构的资金来源、商业关系与方法透明度,都会影响结论的可信度。OpenAI 这份文件的价值,在于把这三类问题摆到台面上,试图为“什么样的第三方评估才算数”提供一套可讨论的标准。

影响与看点

对模型厂商而言,这意味着安全叙事正在从“我们内部做了很多”转向“外部可以验证我们做了什么”。谁能提供可复现、可审计的评估接口,谁在监管沟通中就更有筹码。对开发者与企业用户,第三方评估结果未来可能成为选型与合规采购的参考项,类似安全认证在云服务中的角色。对评估机构与学术团队,门槛会提高:不仅要有攻击与评测能力,还要有保密、隔离与利益冲突管理的工程能力。

值得关注的几个具体方向:评估的访问级别如何分级(黑盒、灰盒、白盒),不同级别对应哪些结论;评估结果如何披露,是全公开、摘要公开还是仅向监管提交;以及“安全评估”与“能力评估”的边界如何划定——同一套测试方法,既可以用来发现风险,也可能被用来定位能力上限。

一个判断:第三方评估的难点不在技术,而在制度设计。真正决定其可信度的,是访问权限、披露规则与利益冲突机制,而不是又多了一份评测榜单。