当整个行业都在把“多智能体协作”当作能力上限的象征时,来自 OpenAI Codex 团队的一线开发者给出了相反的经验判断:智能体不是越多越好。
发生了什么
OpenAI Codex 开发者 Eric Provencher 公开提醒,运行超过两个并行子智能体,几乎总是烧掉大量 token 却换不来质量提升。原因在于智能体之间缺乏信任,会互相重复检查彼此的工作,他把这部分开销称为“协调税”(coordination tax)。他举了一个项目为例:1,393 个智能体在一次 Python 重构上消耗了约两万美元的 token,而这类任务单个 Astra 智能体本可以完成。
为什么重要
多智能体(multi-agent)在过去一年成了默认的叙事方向:拆角色、开子任务、并行跑、互相评审,看起来既像人类团队又像分布式系统。但 Provencher 的观察戳破了一个被忽视的成本结构——智能体的“协作”并不像人类团队那样天然分工,它们没有共享的信任模型,也没有对彼此能力的先验判断,于是只能靠反复验证来兜底。
这解释了一个反直觉现象:并行度越高,单次任务的边际收益越薄,而 token 账单几乎线性甚至超线性增长。当任务本身是单点可解的(比如一次重构),把智能体数量堆到四位数,本质上是在用算力模拟“不信任”,而不是在提升能力。
影响与看点
对开发者而言,这意味着多智能体架构需要重新被当作成本问题而非能力问题来设计。值得关注的方向包括:如何让子智能体共享上下文与结论以减少重复校验、如何用置信度或分工边界替代无差别交叉验证、以及何时应该果断退回单智能体。对用户和企业来说,token 成本直接决定 agent 产品的定价与可行性,一个“看起来更聪明”的架构如果账单翻十倍,商业上并不成立。
我的判断是:多智能体的价值不在数量,而在是否存在真正不可压缩的并行结构。没有这种结构时,协调税会吃掉全部收益——把智能体当团队来堆,往往只是把不确定性换成了账单。



