OpenAI 最新模型 GPT-5.6 Sol 在 Artificial Analysis 智能指数上得 59 分,仅落后 Anthropic 的 Claude Fable 5 一分,但每次任务成本仅 1.04 美元,为后者的三分之一。在智能体编程任务中,Sol 更是击败所有对手。

发生了什么

据 The Decoder 报道,OpenAI 的 GPT-5.6 Sol 在 Artificial Analysis 智能指数(AAI)上获得 59 分,仅比 Anthropic 的 Claude Fable 5 低 1 分。更引人注目的是成本差异:Sol 每次任务成本为 1.04 美元,而 Fable 5 约为 3.12 美元,Sol 的成本仅为后者的三分之一。在智能体编程(agentic coding)基准测试中,Sol 的表现超过了所有竞争对手,包括 Fable 5。

为什么重要

这一对比凸显了当前 AI 模型竞争的两个关键维度:性能与成本。长期以来,Anthropic 的 Claude 系列在复杂推理和编程任务上保持领先,但 OpenAI 正在以更具性价比的模型缩小差距。Sol 在综合基准上几乎持平 Fable 5,同时成本大幅降低,这意味着开发者可以在预算有限的情况下获得接近顶级的能力。

此外,智能体编程能力的提升尤为关键。随着 AI 编程助手从代码补全向自主完成任务演进,模型在 agentic 场景下的表现直接决定了其在实际工作流中的价值。Sol 在这一领域的领先,可能加速 AI 编程工具的普及。

影响与看点

对开发者而言,GPT-5.6 Sol 提供了一个极具吸引力的选择:以较低的成本获得接近顶尖的通用性能,且在编程智能体任务上表现最佳。这可能会促使更多团队将 AI 集成到开发流程中,尤其是在预算敏感的场景。

对于 Anthropic,Sol 的定价压力不容忽视。Fable 5 虽然性能略优,但三倍的成本可能让部分用户转向 OpenAI。Anthropic 可能需要调整定价策略或推出更经济的版本以保持竞争力。

值得关注的是,AAI 指数并非唯一标准,不同任务上的实际表现可能存在差异。此外,模型在安全性、一致性等方面的表现尚未在此次报道中体现,这些因素同样影响实际部署决策。

总体而言,GPT-5.6 Sol 的发布标志着 AI 模型竞争进入性价比比拼的新阶段。性能差距缩小,成本成为关键差异化因素。未来,我们可能会看到更多模型在保持高性能的同时,通过优化推理效率来降低价格。