JetBrains 用一个小体量的开源 MoE 模型,给出了编程智能体领域一个值得注意的信号:真实仓库里的强化学习,可能比单纯堆参数更能决定一个模型能否真正修好代码。
发生了什么
JetBrains 发布了 Mellum2.1,采用 Apache 2.0 许可。这是一个 12B 总参数的混合专家(MoE)思考模型,推理时仅激活 2.5B 参数。官方信息显示,通过在真实代码仓库中进行强化学习,该模型在 SWE-bench Verified 上的得分从 2.0 提升到 47.0。
为什么重要
SWE-bench Verified 衡量的是模型能否在真实开源仓库中定位并修复 issue,是当前编程智能体最受关注的能力标尺之一。从 2.0 到 47.0 的跨度,说明模型并非靠预训练知识“碰巧”答对,而是通过与环境交互、接收测试反馈,学会了多步修改代码的行为模式。
更值得关注的是参数效率。12B 总参数、2.5B 激活的 MoE 架构,意味着推理成本远低于同量级稠密模型。JetBrains 选择 Apache 2.0 开源,也让这套能力可以被本地部署或二次微调。对一家以 IDE 为主业的公司而言,自研并开源编程模型,既是补齐工具链的一环,也是在编程智能体竞争加剧的背景下,避免关键能力受制于外部 API 的务实选择。
影响与看点
对开发者来说,一个可本地运行、许可宽松的编程智能体模型,意味着在隐私敏感或离线场景中多了一个可选项。2.5B 的激活参数也让它在消费级硬件上的可行性明显高于动辄数十 B 激活的模型。
对行业而言,这条消息再次印证了一个趋势:编程智能体的竞争重心,正在从“基座模型有多大”转向“后训练与强化学习环境有多真实”。真实仓库、真实测试、真实反馈,正在成为拉开差距的关键变量。JetBrains 把 RL 放在真实仓库中做,而不是合成任务,这一点比分数本身更值得同行参考。
需要克制看待的是,47.0 的 SWE-bench Verified 分数在当前编程智能体梯队中属于中上水平,并非顶尖。MoE 架构在智能体长链路任务中的稳定性、工具调用的可靠性,以及 JetBrains 自家 IDE 生态会如何集成这个模型,都还有待更多实测与后续信息。一个独立判断是:Mellum2.1 的价值未必在于分数本身,而在于它示范了一条“小激活参数 + 真实环境 RL”的可行路径,这可能会影响更多团队的后训练策略。



