当大多数模型还在比拼谁写得更多、更长时,Liquid AI 选择了一条反方向的路:让模型一个字都不写。
发生了什么
Liquid AI 在其 d1 决策模型家族下开源了两款权重开放的多模态模型。d1-3B 能读取文本与图像;d1-omni-600M 则支持「文本+图像」或「文本+音频」的输入组合。两者的共同点是:它们不生成自然语言文本,而是在单次前向传播中直接返回经过校准的、带类型的答案,输出 token 数为零。官方将目标场景定位为实时决策。
为什么重要
当前主流多模态模型的工作方式,是先「理解」再「用文字表达」。这套范式在对话、写作、摘要等任务上表现优异,但一旦落到需要低延迟、确定性输出的场景,文本生成就成了负担——模型要先想清楚,再逐字吐出来,每一步都在消耗时间和算力。
d1 的思路是把「表达」这一层直接砍掉。模型不再输出一段话让下游去解析,而是直接给出结构化结果。这带来两个直接后果:一是延迟大幅下降,因为省去了自回归逐 token 生成的过程;二是输出格式天然稳定,不需要额外的解析或约束解码来保证可被程序消费。对于需要模型嵌进实时控制回路、或者要在边缘设备上跑推理的场景,这种设计比「更强的通用模型」更对症。
值得注意的是「校准」这个限定词。它意味着模型给出的不只是答案,还有对自身确定性的估计——这在决策场景里往往比答案本身更关键,因为下游系统需要知道何时该信任模型、何时该回退到规则或人工。
影响与看点
对开发者而言,这类模型提供了一种新的集成范式:不是把 LLM 当作会说话的接口,而是当作一个可调用的、输出类型明确的函数。这可能会改变一部分 agent 与工具调用链路的设计——如果模型能直接返回决策结果,中间那层「让模型输出 JSON 再解析」的胶水代码就有机会被省掉。
对行业来说,d1 代表了对「大模型必须会说话」这一默认假设的挑战。决策与生成本就是两类任务,把它们塞进同一个自回归框架里,是一种工程上的妥协。把两者拆开,各自用更合适的架构,未必不是更务实的方向。
需要保持克制的是:目前公开的信息有限,模型的实际决策准确率、校准质量、以及在真实延迟敏感场景下的表现,都还需要第三方评测来验证。「零输出 token」在概念上很干净,但它能否在复杂、开放式的决策任务上站得住,仍是未知数。
一个值得记住的判断是:当生成能力逐渐商品化,真正稀缺的会是「在正确时刻给出正确且可被信任的答案」的能力。d1 押注的正是这一点。


