多智能体协作正在被当作提升 AI 输出质量的标准答案,但最新研究给出的答案并不好看:它更像是一种昂贵的心理安慰。

发生了什么

据 The Decoder 报道,Vals AI 的测试发现,由多个 AI 智能体组成的团队相比单体智能体,表现几乎没有提升,而成本最高可达后者的 5.1 倍。在涉及 GPT-6 Sol 与 Claude Opus 5.5 的四项测试中,只有一项出现了可测量的质量增益。

Anthropic 自身的数据也支持这一判断:当智能体数量超过十个之后,质量曲线趋于平坦,而 Token 消耗继续上升。换句话说,增加智能体数量带来的边际收益,在某个点之后迅速趋近于零。

为什么重要

多智能体(multi-agent)是过去一段时间最受追捧的架构叙事之一。从「规划者—执行者—审查者」的角色分工,到多个智能体互相辩论、投票、交叉验证,这套思路在直觉上非常诱人:更多视角、更多检查、更多冗余,理应带来更可靠的结果。

但直觉在工程里经常失效。多智能体系统的真实成本不只是 Token 账单,还包括延迟、上下文膨胀、错误在智能体之间传播和放大,以及调试难度的指数级上升。当一个智能体产生幻觉,下游智能体往往会把它当作事实继续加工,而不是纠正它——这种「共识性错误」比单体模型的错误更难发现。

这项研究的意义在于,它把讨论从「多智能体是否更强」拉回到「多智能体在什么条件下更值得」。答案很可能是:只在任务可以被清晰分解、且子任务之间几乎不共享上下文时,分工才有意义。

影响与看点

对开发者而言,最直接的建议是:先跑单体基线,再考虑加智能体。如果单模型加更好的提示词、工具调用或检索就能达到相近效果,多智能体架构带来的复杂度就是纯负债。评估时也不应只看最终质量,而要把 Token 成本、延迟和失败模式一起纳入对比。

对平台和 API 提供方而言,这是一个微妙的信号。多智能体是 Token 消耗的重要放大器,但若客户发现投入产出比不成立,这种增长并不可持续。长期看,能帮助用户「少花 Token 办成事」的能力——更好的上下文管理、缓存、任务路由——可能比鼓励无节制编排更有商业价值。

值得关注的还有评测方法本身。目前多数多智能体研究依赖少数基准和少量模型组合,结论的普适性仍需更多独立复现。但方向已经清楚:智能体数量不是质量旋钮,把它当成质量旋钮,代价会体现在账单上。