一家欧洲AI公司用自己的标准给中国大模型打分,结论是中国模型在敏感议题上要么复述官方口径,要么拒绝作答。这个结论不意外,但谁在说、按什么标准说,比结论本身更值得看。

发生了什么

据 The Decoder 报道,德国AI公司 Aleph Alpha 发布了一项针对中国大模型的评测,考察其在政治敏感问题上的回答表现。结果显示,只有 17% 到 41% 的回答被判定为“平衡”(balanced),其余多数表现为跟随官方立场或直接拒答。报道同时指出,Aleph Alpha 的主营业务是向政府客户销售“主权AI”(sovereign AI),这使其在区分自家模型与中国竞品方面存在明确的商业利益。

为什么重要

中国大模型在内容合规上的取向并非秘密。国内《生成式人工智能服务管理暂行办法》要求模型输出符合社会主义核心价值观,厂商在训练与推理两端都做了对齐,敏感话题的拒答或定调是合规设计的直接结果,而非模型能力缺陷。真正有信息量的部分在于:这类评测把“合规行为”翻译成了“能力/中立性得分”,而评分标准由一家有竞争关系的厂商制定。

“平衡”本身不是一个中立的技术指标。它隐含了一套关于AI应当如何回答争议性问题的价值预设——即模型应呈现多方观点、不下判断。这套预设在欧洲公共讨论中常见,但它既非普适,也不等同于事实准确性。用一套区域性价值框架去衡量另一套合规体系下的模型,结论的参照系需要被明确标注。

同时,Aleph Alpha 的“主权AI”叙事依赖一个前提:各国政府需要不受外国价值观影响的本地模型。中国模型“立场鲜明”恰好是这个叙事最好的对照物。这不意味着评测数据造假,但意味着结论的呈现方式与商业动机高度同向。

影响与看点

对开发者而言,这类评测的实际价值有限——它衡量的是对齐策略,不是推理、代码或工具调用能力,不能作为选型依据。对出海团队,值得关注的是反向风险:面向欧美市场的产品若调用中国模型API,可能因输出立场问题触发合规或舆情争议;反之,面向国内市场的产品若接入海外模型,同样面临内容审核压力。

更值得追踪的是评测方法论的透明度:样本量、问题集构成、判定“平衡”的具体规则、是否做多轮复测,这些细节决定了 17% 到 41% 这个区间有多少解释力。目前公开信息不足以支撑对具体模型做精细比较。

一个独立判断:把“是否复述官方立场”当作模型质量指标,本质上是把政治立场测量包装成技术评测。这类报告会越来越多,读者需要先看发布者卖什么,再看它测什么。