小模型正在成为大模型厂商真正争夺的战场——这一次,Anthropic 把长上下文和低价同时压进了 Haiku 这条产品线。

发生了什么

据 MarkTechPost 报道,Anthropic 发布了 Claude Haiku 5.5。官方披露的关键信息有三点:输入价格起步为每百万 token 0.10 美元;保留 1M 的上下文窗口;在 OSWorld 基准上得分 72.4%。

Haiku 一直是 Claude 家族中定位最小、最快、最便宜的一档,与 Sonnet、Opus 形成明显的价格与能力梯度。此次更新没有改变这一定位,而是在原有档位上继续加量:上下文规模维持百万级,价格进一步下探,同时给出了一个可横向比较的智能体基准成绩。

为什么重要

过去两年,模型能力的叙事集中在旗舰模型上,但真正决定 AI 能否大规模落地的,往往是便宜那一档。原因很直接:智能体(agent)类应用需要反复调用模型、读取大量上下文、执行多步操作,token 消耗是普通对话的几十倍甚至更多。如果小模型在长上下文和工具调用上不够用,开发者就只能被迫用贵模型,成本结构立刻失衡。

1M 上下文此前更像是旗舰模型的卖点。把它放到 Haiku 这一价格档,意味着"长文档 + 低单价"可以同时成立,这在工程上会改变不少架构选择——比如是否还需要自建复杂的检索与分块管线,是否可以把整份代码库、整本手册、整段会话历史直接塞进上下文。

OSWorld 这个基准同样值得注意。它衡量的是模型在真实操作系统环境中完成多步任务的能力,属于典型的智能体评测,而不是单轮问答。小模型在这个维度上的分数,直接关系到它能否承担"执行层"的角色。

影响与看点

对开发者而言,最现实的变化是成本模型的重算。0.10 美元每百万输入 token 这一档位,让高频、批量、长输入的场景第一次具备了经济可行性,例如大规模文档处理、代码库级分析、持续运行的自动化流程。

对行业而言,这延续了一个清晰趋势:小模型不再只是"便宜但笨"的降级选项,而是在特定任务上逼近可用水平,厂商之间的竞争从"谁的旗舰更强"转向"谁的性价比曲线更陡"。

需要保持克制的地方也很明显。价格与上下文是官方口径,但 72.4% 的 OSWorld 成绩缺少任务设置、工具权限、对比基线等细节,单看数字不足以判断实际能力边界。长上下文在真实使用中的有效召回率、多步任务中的稳定性,仍需开发者自行验证。

一句话判断:Haiku 5.5 的价值不在于刷新能力上限,而在于把"长上下文 + 智能体执行 + 低单价"这三件事同时拉到了可规模化的区间,这会比又一次旗舰升级更快地改变开发者的默认选型。