当行业还在争论智能体何时能规模化落地时,一个更现实的问题已经浮出水面:跑得起吗?
发生了什么
OpenAI 公布了一个来自 Asana 的案例:在 Codex 中使用 GPT-6 Astra 模型后,Asana 的浏览器智能体在测试中实现了约 76 倍的成本下降和 5 倍的速度提升,从而能够向客户提供能力更强的模型。
需要说明的是,这些数字来自测试环境,并非生产环境的长期统计;OpenAI 也未披露具体的计费口径、任务类型分布和对比基线。因此把它理解为“方向性证据”比当作“精确基准”更稳妥。
为什么重要
浏览器智能体是当前最“烧钱”的一类 Agent 形态。它需要持续读取页面、理解 DOM 或截图、规划多步操作、处理弹窗与异常,每一步都意味着一次甚至多次模型调用。任务链条越长,token 消耗越呈非线性增长。
这带来一个长期矛盾:模型能力越强,单次调用越贵;而智能体的可靠性恰恰依赖强模型。过去两年,很多浏览器 Agent 产品在演示阶段惊艳,在定价阶段失语——因为按真实用量计费,客户根本付不起。
Asana 这个案例的价值不在于“76 倍”这个数字本身,而在于它指向的路径:把成本压缩到某个阈值以下,原本只能用于内部试验的强模型,才可能被放进面向客户的商业产品里。换句话说,降本不是财务优化,而是产品可行性的前置条件。
值得注意的是,这次降本发生在 Codex 这一编码/执行环境中。这暗示了一条常见思路:让模型在受控的执行框架里完成规划与工具调用,而不是把全部推理都压在通用对话模型上。
影响与看点
对开发者而言,浏览器智能体的架构选择会变得更关键。同样的模型,不同的任务分解方式、缓存策略、页面表示方式(截图 vs 结构化文本),成本可能相差一个数量级。降本空间很大程度上不在模型侧,而在工程侧。
对企业用户而言,这意味着此前因成本被搁置的自动化场景可能重新进入评估清单。但也要警惕:测试环境的成本曲线未必能线性外推到生产环境,长尾任务和异常处理往往才是真正的成本黑洞。
对模型厂商而言,竞争维度正在从“谁更聪明”扩展到“谁在同等能力下更便宜、更快”。Agent 场景对延迟和成本极度敏感,这会反过来影响模型的训练与推理优化方向。
一个独立判断:智能体赛道接下来最值得关注的指标,可能不是任务成功率,而是“每完成一个真实任务的综合成本”。谁能把这个数字压到企业愿意付费的区间,谁才真正拿到了规模化的入场券。



