一句话导语

OpenAI将推理速度本身商品化,通过Ultrafast模式将GPT-5.6 Sol的生成速度提升至每秒750 token,背后是Cerebras的专用芯片。

发生了什么

据The Decoder报道,OpenAI正式推出名为“Ultrafast”的新型推理模式,该模式基于其与Cerebras达成的100亿美元合作,将GPT-5.6 Sol的输出速度提升至每秒750 token,相比标准模式快约14倍。与此同时,OpenAI将推理服务划分为“Standard”、“Fast”和“Ultrafast”三档,形成以速度为维度的定价体系。这一举措意味着,用户可以为更快的响应时间支付额外费用,而不仅仅是按token计费。

为什么重要

过去,大模型API的定价主要基于token数量,速度差异通常被忽略或作为附加特性。OpenAI此次将速度作为独立产品维度,反映了推理优化已成为竞争核心。Cerebras的晶圆级芯片在延迟和吞吐量上具有优势,此次合作不仅为OpenAI提供了差异化能力,也验证了专用硬件在AI推理中的商业价值。对于开发者而言,速度分层意味着可以在成本和用户体验之间做出更精细的权衡:实时交互场景(如客服、编程助手)可选用Ultrafast,而批量处理任务则可用Standard以降低成本。这一模式可能促使其他云服务商跟进,推动推理市场从“按量计费”转向“按需提速”。

影响与看点

首先,对开发者来说,Ultrafast模式将显著改善高交互性应用的响应体验,但需评估成本增量是否值得。其次,OpenAI与Cerebras的深度绑定,可能影响英伟达在AI推理市场的份额,但Cerebras的产能和生态成熟度仍是挑战。值得关注的是,OpenAI是否会进一步将速度分层扩展到其他模型,以及Cerebras芯片在训练与推理中的综合表现。一个独立判断是:速度分层虽能短期提升收入,但长期可能加剧API服务的同质化竞争,真正的护城河仍在于模型能力与生态粘性。