Anthropic 第一次把自己“用 AI 造 AI”的内部账本摊开给外界看,但这份账本的数字需要打个折扣来读。

发生了什么

据 The Decoder 报道,Anthropic 首次公布了一套关于“如何构建自家 AI”的指标。其中最受关注的一条是:在面向未来模型的研究工作中,Claude 已经“主导”(lead)了约 26% 的任务,而在今年 2 月,这个比例还不到 1%。

但报道同时点出了几个关键限定:这一比例背后的统计规模并不清晰;判断某项工作是否由 Claude“主导”的评分,来自 Claude 自己;而“主导”这个词的实际含义,比字面上听起来要弱得多。换句话说,Anthropic 给了一个很有传播力的数字,却没有给出足以支撑这个数字的完整方法论。

为什么重要

过去一年,AI 实验室用模型加速自身研发早已不是秘密——从写代码、跑实验到筛论文,模型越来越多地出现在研究流程的中间环节。但几乎没有人公开过量化数据。Anthropic 此举的意义在于,它把“AI 参与 AI 研发”从坊间传闻变成了一个可被讨论的指标,哪怕这个指标还很粗糙。

这也和 Anthropic 一贯的叙事一致:它既是“AI 可能带来风险”的主要警告者之一,又是把模型推向更自动化研发的实践者。公开这类数据,一方面是透明度的姿态,另一方面也是能力展示——26% 这个数字,本身就是对 Claude 编码与研究辅助能力的一次营销。

真正值得注意的,是评分机制的自我指涉。如果“是否主导”由 Claude 判定,那么这条曲线既可能反映能力的真实提升,也可能反映模型对自身输出的偏好,或任务定义本身的松动。在没有第三方审计和明确口径之前,这个数字更适合当作趋势信号,而不是能力刻度。

影响与看点

对行业而言,Anthropic 可能开启一轮“自研自动化率”的指标竞赛。一旦有实验室开始公布这类数字,其他家就有压力跟进,而各家口径不同会让横向比较变得困难——这恰恰是读者需要警惕的地方。

对开发者来说,更实际的信号是:模型在长链条研究任务中的可用性正在快速提升。如果 Claude 真能在四分之一的研究环节承担主导角色,那么它在代码库理解、实验设计、结果分析等场景的工程价值,可能比基准测试分数更能说明问题。

需要盯住的有三点:Anthropic 后续是否补充统计口径与样本规模;评分是否引入人工或第三方校验;以及“主导”的定义会不会随着比例上升而被悄悄放宽。

一个克制的判断是:这条新闻的价值不在于 26% 这个数字本身,而在于它标志着 AI 实验室开始把“自我加速”当作可以对外汇报的指标——而这套指标的可靠性,目前还远未建立。