一次独立审计,把 OpenAI 的青少年安全承诺推到了聚光灯下。
发生了什么
Common Sense Media 旗下的青年 AI 安全研究所对 ChatGPT 的青少年保护功能做了一轮独立审计。据 The Decoder 报道,测试使用了 4000 多条提示词,最终该机构给 ChatGPT 对未成年人的风险评级定为"不可接受"。
最关键的发现不是模型回答本身,而是安全机制的执行环节:在测试账号中,涉及自杀和自残的对话始终没有触发家长警报。也就是说,OpenAI 面向家长设计的"知情与介入"通道,在最需要它的场景里没有生效。
基于这一结果,该研究所的立场是:在安全能力能够被独立验证之前,青少年应当被挡在门外。
为什么重要
这件事的分量,来自它同时踩中了三条线。
第一是产品线。OpenAI 近一年持续强调青少年安全,家长控制、敏感话题干预、年龄识别都是对外沟通中的重点。审计结果等于说:这些功能在纸面上存在,在真实对话流里却可能失灵。安全功能"存在"和"有效"之间的差距,正是这类审计最有价值的地方。
第二是治理线。这次评估不是来自监管机构,也不是来自 OpenAI 自己,而是来自一家长期做儿童与家庭数字内容评级的第三方机构。这延续了一个正在成型的模式:AI 安全正在从厂商自证,转向外部独立验证。对家长和学校来说,第三方评级比厂商博客更有说服力;对厂商来说,这意味着安全叙事不再能单方面定义。
第三是责任线。当对话涉及自杀与自残,产品的角色就不再是"信息工具",而接近"危机接触点"。此时家长警报失效,不只是功能缺陷,而是风险处置链条的断裂。
影响与看点
对 OpenAI 而言,短期压力集中在两点:家长警报为何未触发,以及触发逻辑能否被外部复现和验证。这类问题的棘手之处在于,它往往不是单一 bug,而是分类器阈值、上下文判断、账号年龄状态、通知链路共同作用的结果——修起来比解释起来难。
对行业而言,这次审计给出了一个可复用的模板:用大规模提示集去压测安全机制,并公开评级。如果这种做法扩散,青少年安全可能像内容审核一样,从"自评"走向"他评",甚至成为应用商店、学校采购、家长选择的事实门槛。
对开发者和做 AI 产品的团队,值得记下的一条经验是:涉及未成年人和心理危机的场景,安全设计不能只做"模型层拦截",还要验证"通知层是否真的送达"。很多团队把精力放在让模型拒答,却忽略了拒答之后应该发生什么。
一个克制的判断:这次争议的核心不是 ChatGPT 会不会说错话,而是当它遇到最不该出错的对话时,承诺给家长的那条通道是否真的通着。在独立验证成为常态之前,厂商的安全声明都应当被当作待验证项,而不是结论。



