当大多数模型还在比拼“写得多好”时,vLLM 生态里长出了一类只负责“做判断”的模型。
发生了什么
vLLM Semantic Router 发布了 Decision 3.0,一次性放出 5 个多模态决策模型,参数规模覆盖 0.8B 到 27B,全部采用 Apache-2.0 许可。这些模型的定位与常规大模型明显不同:它们不生成自然语言文本,而是在单次调用中直接输出决策结果,支持三类任务——选择题、是非题(yes/no)以及打分题,输入可以是文本,也可以是图像。
换句话说,它把“模型输出”从一段话压缩成一个答案或一个分数。
为什么重要
语义路由本身解决的是“请求该交给哪个模型/哪条链路”的问题。传统做法要么靠规则和关键词匹配,要么调用一个通用大模型做意图分类,后者成本高、延迟大,而且输出不稳定——同一个问题可能生成格式各异的解释文字,还需要额外解析。
Decision 3.0 的思路是把这类判断任务从通用模型中剥离出来,训练成专用的小型决策模型。不生成文本意味着输出空间被大幅收窄,推理开销和延迟随之下降,输出格式也天然规整,省掉了后处理环节。0.8B 这一档的存在尤其关键:它让“每次请求都过一次模型判断”在成本上变得可行,而不是只在关键节点才舍得调用。
多模态是另一个值得注意的点。支持图像输入意味着决策范围从纯文本意图扩展到了带视觉信息的场景,比如判断一张图是否属于某类内容、图文是否匹配。Apache-2.0 许可则降低了商用和二次训练的门槛,这对需要在私有环境里部署路由层的团队来说,比单纯的性能指标更有吸引力。
影响与看点
对开发者而言,最直接的变化是路由层可以做得更轻。过去为了判断用户意图而调用大模型,往往占掉相当一部分延迟预算;换成专用决策模型后,这部分开销有机会被压缩到可忽略的量级。对做 Agent 和工具调用的团队来说,是非题和打分题这两类输出,天然适合做“要不要触发某个动作”“这个结果够不够好”的闸门判断。
需要观察的地方也很明确。第一,决策模型的准确率上限在哪——小模型在边界模糊的意图上容易出错,而路由判断一旦出错,后续链路全错,容错空间比生成任务更小。第二,从 0.8B 到 27B 的跨度意味着存在明显的精度与成本权衡,实际选型需要结合具体场景验证,而不是默认取大。第三,不生成文本虽然提升了效率,但也牺牲了可解释性,出问题时排查会比读一段模型解释更困难。
一个值得记住的判断是:模型的能力正在从“通用”向“分工”演化,决策这类高频、低创造性、对格式敏感的任务,很可能会持续从通用大模型中剥离出来,成为独立的一层基础设施。Decision 3.0 是这个方向上一次比较明确的落子。



