当模型能力越来越接近,评测本身正在变成一门独立的生意。

发生了什么

据 TechCrunch 报道,热门 AI 模型排行榜 LMArena 的母公司完成了一轮 2 亿美元融资,由 Lightspeed 和 Khosla 领投,估值达到 31 亿美元。距离上一轮融资仅过去约十个月,估值几乎翻倍。

与融资同时释放的信号是评测范围的扩张:LMArena 不再只衡量模型答题好不好,而是开始把对齐层面的问题纳入评测,例如模型是否会撒谎。

为什么重要

LMArena 的起点是聊天机器人竞技场——用户向两个匿名模型提同一个问题,投票选出更好的回答,再揭晓模型身份。这种基于真实用户偏好的盲测,让它成为模型发布后被引用最多的第三方榜单之一,也让它天然带有社区属性而非实验室属性。

但偏好投票一直存在争议:人类更偏爱长回答、格式漂亮的回答,甚至更偏爱自信的语气,这些偏好未必等同于能力。当各家模型的基准分数普遍逼近饱和,排行榜的说服力就开始从“谁分高”转向“测什么、怎么测”。

把“撒谎”这类对齐指标纳入评测,正是这一转向的体现。它意味着评测机构的角色正在从裁判变成标准制定者:定义什么算好模型,本身就会反向影响实验室的训练目标和发布叙事。

影响与看点

对模型厂商而言,一个被广泛引用的第三方榜单既是曝光渠道,也是压力来源。估值翻倍说明资本市场认可“评测即基础设施”的逻辑,但这也让中立性问题变得更尖锐——当排行榜公司本身成为高估值创业公司,它的收入来自谁、如何避免与模型厂商的利益绑定,会成为持续被追问的问题。

对开发者来说,实际影响更直接:如果对齐类指标被纳入常规榜单,选型时就不能只看能力分,还要看模型在诚实性、拒答边界上的表现,尤其是面向终端用户的产品。

值得关注的是方法论的透明度。撒谎、欺骗这类行为很难用单一分数刻画,评测设计一旦不公开,结论就很难被复现,排行榜的公信力反而会被稀释。

评测正在从附属品变成主战场。谁能定义“好模型”,谁就在一定程度上定义了模型的发展方向。