AI评测的公正性一直是行业痛点,如今DeepMind迈出了关键一步。
发生了什么
谷歌DeepMind正在试点全球首个双盲AI评测。所谓双盲,即评测者和被评测的AI模型双方都不知道对方身份——评测者无法区分哪个回答来自哪个模型,模型也无法针对特定评测者优化。这种设计旨在消除评估过程中的主观偏见和潜在的“应试”行为。目前该试点处于早期阶段,具体细节有限,但方向明确:让AI能力对比更接近科学实验。
为什么重要
当前AI评测面临两大困境:一是人类评测者容易受模型知名度、回答风格等非能力因素影响,导致评分失真;二是模型可能通过训练数据“记住”评测基准,产生虚高的分数。双盲设计能同时缓解这两个问题——评测者无法预知模型身份,模型也无法针对特定评测者或基准进行针对性优化。这类似于医学中的双盲试验,是提高结果可信度的金标准。DeepMind作为头部实验室,其试点可能推动整个行业采纳更严谨的评测规范,为模型排名、学术研究和产品选型提供更可靠的依据。
影响与看点
对开发者而言,双盲评测意味着模型对比结果更值得信赖,但也可能暴露一些模型在“盲测”下表现不如预期,引发排名洗牌。对评测平台和基准组织者,这可能是新的竞争方向——如何设计防作弊、防偏见的评测流程。值得关注的是,双盲能否真正落地,因为AI模型可能通过输出风格等隐式线索泄露身份,且评测任务本身可能难以完全标准化。我的判断是:双盲评测不会解决所有问题,但它是AI评估走向成熟的重要一步,未来可能成为高 stakes 评测的标配。
(本文基于公开信息撰写,不包含未公开细节。)



