Cloudflare 正在把 AI Agent 的"决策"从文本生成中剥离出来,做成一个独立的、可被调用的模型层。

发生了什么

Cloudflare 发布了两个新模型:Clef 和 Clef-flash。它们的目标不是写文章、答问题,而是让 AI Agent 在不生成自然语言的前提下,直接做出结构化决策——也就是把"下一步该做什么"变成一个分类任务,而不是一段需要被解析的文本。

两个模型都构建在 Qwen 之上,采用 Apache 2.0 许可。其中 Clef-flash 的分类延迟约为 39 毫秒,据称比 TypeSafe AI 的 Jev 决策模型快十倍以上。Cloudflare 在表述中把这一方向概括为:Agent 的决策环节不再需要人类留在回路里。

为什么重要

当前主流 Agent 架构有一个被默认接受的低效环节:模型先"想"出一段文字,再由外部代码去解析这段文字,从中提取意图、参数和下一步动作。这套流程带来了三个问题——延迟高、解析容易出错、成本随 token 增长。

Clef 的思路是把这一步压缩掉。既然 Agent 在大多数节点上要做的只是"在有限选项里选一个",那就不必生成完整句子,直接输出分类结果即可。39 毫秒这个量级的意义在于,它让决策环节的耗时接近一次普通函数调用,而不是一次 LLM 推理。对于需要高频循环、快速试错的 Agent 工作流,这是数量级上的差别。

对标对象也值得注意。TypeSafe AI 的 Jev 是这一细分方向上较早被讨论的产品,Cloudflare 选择正面比较速度,说明它把"决策模型"视为一个独立品类,而非通用模型的附属功能。

影响与看点

对开发者而言,最直接的变化是 Agent 循环的写法可能被简化:原本需要 prompt 工程 + 输出解析 + 重试逻辑的环节,可以替换为一次低延迟分类调用。这既降低了工程复杂度,也减少了因解析失败导致的 Agent"跑偏"。

选择 Qwen 作为底座并以 Apache 2.0 发布,意味着模型可以被自托管和微调。对于把 Agent 部署在边缘或私有环境的团队,这一点比单纯的性能数字更有价值——决策模型往往需要贴合具体业务的动作空间,可微调是刚需。

需要保持克制的地方在于:"人类不再需要留在回路里"是一个方向性表述,而非已经完成的结论。决策模型解决的是"选哪个动作",但动作空间的定义、边界条件的设定、以及高风险操作的人工确认,仍然需要人来设计。真正被移除的,是那些低价值、高频次的人工确认,而不是全部监督。

值得关注的是,如果决策模型这一层被标准化,Agent 的架构可能会进一步分层:通用模型负责理解与生成,专用小模型负责高频决策。这对推理成本和响应速度都是利好,但也意味着 Agent 的能力上限会更多取决于决策模型的动作空间设计,而非底层大模型的规模。