当大多数模型还在比拼谁能写出更漂亮的句子时,Nace AI 把模型的目标换成了另一件事:在多个选项之间做出判断。

发生了什么

Nace.AI 开源了 Drex 1.5,一个 90 亿参数规模的决策模型。它的输出不是自然语言文本,而是为给定问题下的每一个候选选项返回一个概率分数——也就是说,它做的是排序和选择,而不是续写。据 MarkTechPost 报道,该模型在单次前向传播中即可完成对所有选项的打分,上下文窗口最高支持 128K tokens,并在 Decision Index 0.3.1 这一评测基准上取得 58.08 分。模型以开源形式发布,具体权重与许可细节可查阅其发布页面。

为什么重要

当前主流大模型的交互范式是“生成”:你给一段提示,它吐出一段文本,再由人或下游程序去解析、比较、决策。这套流程在开放问答里很自然,但一旦落到需要从有限选项中挑一个的场景——路由选择、候选排序、A/B 方案评估、多智能体投票——生成式接口反而显得笨重:模型要先写出理由,再给出结论,中间还可能自相矛盾。

Drex 1.5 的思路是把决策本身当作建模对象。选项作为输入的一部分,模型直接输出每个选项的概率分布,省去了“生成再解析”的环节。这种设计在工程上更接近分类器或排序模型,却保留了 Transformer 对长上下文的理解能力。128K 的窗口意味着它可以一次性读入较长的背景材料、规则说明或多个候选方案的完整描述,再统一打分。

从行业背景看,这契合了近期的一个明显趋势:把大模型从“聊天框”里解放出来,嵌入到具体的决策链路中。无论是 LLM 路由、推荐重排,还是智能体在工具调用前的方案筛选,都需要一个便宜、稳定、可批量执行的打分器。9B 的体量也让它比动辄数百 B 的通用模型更容易私有化部署。

影响与看点

对开发者而言,最直接的价值是接口形态的变化。传统做法是让模型输出 JSON 或选项字母,再写解析逻辑兜底;Drex 这类模型把概率直接暴露出来,调用方可以按阈值过滤、按分数排序,甚至把概率作为下游系统的输入特征。这在构建多智能体系统或工具路由时,能减少一层脆弱的文本解析。

需要冷静看待的是评测口径。Decision Index 0.3.1 并非广为人知的标准基准,58.08 这个分数目前缺乏跨模型的横向对照,单看数字无法判断它相对通用大模型的实际优势。真正的检验,还是要看它在具体业务场景中的排序质量、延迟和成本。

另一个值得关注的点是“决策模型”这一品类能否独立成立。如果通用大模型通过提示工程也能达到相近的选项打分效果,专用模型的价值就需要用推理成本、稳定性和吞吐量来证明。Drex 1.5 的开源,至少给这个方向提供了一个可复现的起点。

我的判断是:这类模型不会取代通用大模型,但很可能成为决策链路里的一层专用组件——就像排序模型在推荐系统中的地位一样,不显眼,却难以绕过。