当大多数模型还在比谁写得更像人时,微软把注意力转向了另一个问题:让模型只负责做判断。

发生了什么

微软发布了 Microsoft-Decision-1,官方定位是「决策模型」,面向路由、分类、验证和智能体控制等场景。它最核心的设计取向是:不生成文本,而是针对一组固定答案选项,为每个选项返回一个经过校准的概率值。

该模型由阿里巴巴的 Qwen3.5-9B 后训练而来,目前已在 Microsoft Foundry 和 OpenRouter 上线。

为什么重要

过去两年,行业默认用同一个对话模型包办所有事情——写文案、调工具、做判断。但把「判断」交给生成式模型,本质上是用一个为流畅表达优化的系统去做需要确定性的工作:输出是自由文本,需要额外解析;置信度藏在 token 概率里,难以直接使用;同一输入还可能给出不同措辞的答案。

Decision-1 的思路是把这类任务从「生成」重新定义为「打分」。选项固定、输出是数值、概率经过校准,意味着下游系统可以直接拿这个分数做阈值判断、做级联路由、做失败回退。对智能体而言,这正好补上了控制层最缺的一环:不是让模型更聪明,而是让它在关键分叉点上更可预测、更可度量。

选择 Qwen3.5-9B 作为基座也值得注意。9B 量级意味着推理成本和延迟可控,适合高频、低延迟的调用场景;而基于一个开源中系模型做后训练,也延续了微软在模型组合上务实、不绑定单一来源的策略。

影响与看点

对开发者来说,最直接的变化是集成方式。以往要判断「这条工单属于哪一类」「这个请求该走哪条链路」「工具调用结果是否可信」,往往要靠提示词工程加正则解析,脆弱且难评估。决策打分模型把这一步变成标准的分类接口,配合校准概率,可以更容易地设定阈值、监控分布漂移、做 A/B 对比。

对智能体框架而言,这类模型的想象空间在编排层:用一个小而快的打分模型做守门人和裁判,把昂贵的大模型留给真正需要生成能力的环节。这可能是成本结构上更合理的一种分工。

值得观察的点有三个:一是「校准」在真实业务分布上是否站得住,这需要第三方评测而非厂商自述;二是固定选项的设定是否足够灵活,能否覆盖开放式判断;三是它与既有评测体系的关系——当模型不再输出文本,传统基准大多失效,行业需要新的衡量方式。

一个相对克制的判断是:Decision-1 本身未必是能力上的跃迁,但它代表了一种更成熟的产品思路——把「生成」和「判断」拆开,各用各的工具。如果这条路走通,未来我们看到的可能不是更大的模型,而是更多分工明确的小模型。