小模型的价格战,正在成为大模型竞争最激烈的前线。

发生了什么

Anthropic 发布了新一代小模型 Claude Haiku 5.5。据 The Decoder 报道,它在基准测试中大幅超越前代:在衡量模型操作电脑能力的 OSWorld 测试上,成绩从上一代的 15.7% 提升到 72.4%,属于跨代级别的跃升。

价格方面,Anthropic 将 token 单价最高下调约 90%。但报道同时指出一个容易被忽略的细节:新模型采用了新的分词器(tokenizer),完成同一任务会消耗更多 token,因此实际账单的降幅会小于名义上的降价幅度。

为什么重要

Haiku 系列一直是 Anthropic 产品线中定位“快而便宜”的一档,主要面向高并发、低延迟、成本敏感的场景。这次升级有两个信号值得注意。

第一,小模型的能力上限在被快速抬高。OSWorld 这类测试考察的是模型能否真正操作图形界面完成任务,属于典型的 agent 能力指标。前代 15.7% 基本意味着“不太能用”,而 72.4% 已经进入可实际部署的区间。这意味着过去只有旗舰模型才能承担的电脑操作类任务,开始向低成本档位下放。

第二,定价战仍在继续。过去一年,主流厂商在旗舰模型上反复调价,如今战火蔓延到小模型档位。降价不只是营销动作,它直接决定开发者会把哪些任务放在哪个模型上——当小模型足够便宜且足够能干,很多原本调用大模型的请求会被迁移过去。

影响与看点

对开发者而言,最实际的变化是架构选择的空间变大了。此前需要权衡“用便宜模型但效果差”还是“用贵模型但成本高”的场景,比如批量网页操作、表单填写、界面自动化,现在多了一个中间选项。但同时要警惕分词器变化带来的成本错觉:名义单价下降不等于单位任务成本同比例下降,真实成本需要用实际任务重新测算,而不是简单对比价目表。

对行业而言,这次发布再次说明,模型竞争的重心正在从“谁的旗舰更强”转向“谁在每一档价位上都更有性价比”。当小模型的能力逼近上一代旗舰,厂商之间的差异化会更多体现在价格、延迟、工具调用稳定性和生态集成上,而非单纯的榜单分数。

一个值得持续观察的点是:分词器效率正在成为隐性竞争维度。同样的文本被切成更多 token,用户的实际支出就会上升,而这一点往往不会出现在宣传口径里。未来评估一个模型是否“便宜”,需要看单位任务成本,而不是每百万 token 的标价。

小模型的价格战,最终受益的是那些把 AI 嵌入高频业务流程的团队——前提是他们算得清真实账单。