一个只有 7.89GB 的 2-bit 量化模型,在工具调用这一项上打赢了 54GB 的原版——这不是参数规模的胜利,而是量化策略的胜利。
发生了什么
MarkTechPost 报道了一个名为 Underdog Saluki 27B 的模型:它是 Qwen3.8-27B 的 2-bit GGUF 量化版本,体积 7.89GB,采用 Apache 2.0 许可。据其描述,它在工具调用(tool calling)任务上超过了 54GB 的原始模型,但在竞赛数学和推理类任务上让出了明显的地盘。
换句话说,这不是一次全面超越,而是一次高度选择性的能力置换:用极小的体积换来某一类任务上的更好表现,代价是另一些能力被牺牲。
为什么重要
2-bit 量化长期被视为「能跑但不好用」的档位。传统认知里,量化到 4-bit 已经接近能力悬崖,2-bit 往往意味着输出崩坏、指令遵循失效。Saluki 27B 的意义在于,它把这个档位重新拉回了可用区间——至少在工具调用这一具体场景里。
更值得玩味的是「反超原版」这件事。量化通常被理解为有损压缩,理论上不可能比原模型更强。出现反超,通常指向几种可能:原模型在工具调用格式上本身存在不稳定或过度冗长的问题,而量化过程意外地压制了这些噪声;或者评测所用的工具调用基准对输出格式、长度、结构化程度敏感,量化后的模型恰好更「听话」。这提示我们,工具调用这类任务衡量的未必只是知识容量,还包括输出纪律。
从部署角度看,7.89GB 与 54GB 的差距是决定性的。前者可以塞进消费级显卡甚至统一内存的设备,后者需要多卡或高显存服务器。对本地部署、边缘场景和成本敏感的开发者来说,这个量级差异直接决定了「能不能用」。
影响与看点
对开发者而言,最实际的启示是:不要默认「越大越好」。如果你的应用以函数调用、结构化输出、Agent 工具编排为主,一个经过精心量化的中小体积模型可能是更划算的选择,尤其在延迟和显存受限的环境里。
但也要保持清醒。报道明确指出它在竞赛数学和推理上退步,这意味着它不适合作为通用助手或需要多步严谨推理的场景。把它当作「工具调用专用件」而非「全能替代品」,才是合理定位。
几个值得继续观察的点:一是这类反超是否可复现,还是特定基准下的偶然;二是 2-bit 量化的稳定性在长上下文、多轮工具调用中是否依然成立;三是 Apache 2.0 许可让它可以被自由集成,这可能会催生一批以工具调用为核心的小体积本地 Agent 方案。
一个独立判断:Saluki 27B 的真正价值不在于「2-bit 打败了原版」这个噱头,而在于它把「量化即降级」的默认假设撕开了一道口子——当任务足够垂直,压缩反而可能是一种正则化。



