当最懂 AI 的人反复低估 AI 的进展速度,我们该信谁的预测?

发生了什么

据 The Decoder 报道,Forecasting Research Institute 的一项研究指出,领先的 AI 专家系统性地低估了该领域的推进速度。两个被点名的例子是:AI 在达到国际数学奥林匹克(IMO)金牌水平这件事上,比专家预测的中位数提前了约五年;而 Anthropic 的年化收入,约为专家此前预测的五倍。

不过,研究并未得出"专家全错"的简单结论。在自动驾驶等真实世界应用上,预测结果呈现出更复杂的图景——部分场景的落地节奏并未如预期般迅猛。

为什么重要

预测偏差本身不是新闻,偏差的方向才是。过去几年,AI 能力边界的扩张主要沿着可验证、可规模化、反馈信号清晰的赛道推进:数学推理、代码、基准测试。这类任务天然适合大规模训练与自动评估,因此进步曲线陡峭,且容易突破人类直觉的线性外推。

而专家群体——即便是顶尖研究者——的预测往往锚定在自身经验与当下瓶颈上,对算力堆叠、数据合成、后训练方法迭代带来的非线性跃升估计不足。当整个行业在同一时间被同一批技术拐点推动时,个体预测的保守会形成系统性偏差。

更值得注意的是收入侧的信号。Anthropic 年化收入达到预测的五倍,说明能力提升正在以比预期更快的速度转化为商业需求。这不仅是技术问题,也是市场对 AI 价值兑现节奏的重新定价。

影响与看点

对行业而言,最直接的启示是:把专家预测当作参考系而非天花板。在能力基准(benchmarks)和模型发布节奏上,保守预测可能持续被证伪。

对开发者和产品团队,这意味着两件事。其一,为模型能力预留比当前需求更大的接口与抽象层,避免每半年重构一次架构。其二,警惕"能力快、落地慢"的错配——自动驾驶的混合图景提醒我们,涉及物理世界、监管、安全与长尾场景的领域,技术曲线与部署曲线并不同步。

对普通用户,值得关注的不是某个具体预测数字,而是这种偏差的持续性:如果专家在能力侧持续低估、在落地侧判断分化,那么真正稀缺的将不是模型本身,而是把快速提升的能力稳定转化为可靠产品的工程与组织能力。

一个独立判断:未来一两年,"预测被提前打破"大概率仍会发生在可自动评估的领域,而真实世界应用的节奏,仍将取决于安全、成本与信任这些慢变量。