当AI模型的能力越来越难以用传统基准衡量,开发者开始用“感觉”来测试模型。Andrej Karpathy的最新实验,或许预示着一个新的评估范式正在形成。

发生了什么

OpenAI联合创始人Andrej Karpathy最近进行了一项实验:他让Claude Opus 5将《指环王》的开篇段落转化为一个3D浏览器场景。据The Decoder报道,输入仅一段托尔金的文字,输出却是5500行代码。Karpathy将这一过程称为“氛围测试”(vibe test),并暗示这可能是评估下一代AI模型的新方式。

这一实验并非孤例。Karpathy此前曾用类似方式测试其他模型,例如让AI生成独角兽或鹈鹕的3D场景,以观察模型的创造力和代码生成能力。这些测试的共同点是:没有标准答案,只有主观感受。

为什么重要

传统上,AI模型通过基准测试(如MMLU、HumanEval)来评估,这些测试有明确的正确答案,可以量化比较。但随着模型能力提升,基准测试的区分度正在下降——顶级模型在多数基准上已接近饱和,分数差异不再能反映实际体验。

“氛围测试”则完全不同。它不追求客观分数,而是关注模型在开放任务中的表现:是否能理解文学意境,是否能生成可运行的代码,是否能在视觉上令人满意。这种测试更接近真实使用场景,也更能捕捉模型的“智能感”。

Karpathy作为AI领域的意见领袖,他的实验可能推动行业重新思考评估方式。如果“氛围测试”成为新趋势,那么模型开发的重心将从优化基准分数转向提升用户体验,这可能导致模型设计哲学的根本转变。

影响与看点

对开发者而言,“氛围测试”提供了一种快速筛选模型的直觉方法,尤其适合创意编程和原型设计。但它的主观性也带来挑战:如何确保测试的可重复性?如何避免“幸存者偏差”?

对模型提供商来说,这意味着他们需要更关注“开箱即用”的体验,而非仅仅堆砌benchmark数字。Claude Opus 5在Karpathy测试中的表现,可能成为其营销的新卖点。

值得关注的是,Karpathy的测试是否会被社区标准化,例如形成一套“氛围测试集”。如果成真,它可能成为非官方的行业标准,与现有基准互补。

我的判断是:氛围测试不会取代基准测试,但它会成为一种重要的补充,尤其适用于评估创造性任务。AI评估的多元化,本身就是行业成熟的标志。