IBM 发布了 Granite 4.2 系列开源语言模型,以 Apache 2.0 协议完全开放,并内置了智能体(agentic)能力。这一举动在开源模型领域投下了一枚重磅炸弹,因为其不仅提供了多种尺寸选择,更在训练方法上进行了创新,让模型自主学会使用工具和执行代码。

发生了什么

Granite 4.2 系列包含 3B、8B 和 30B 三种参数规模的模型,训练数据量约为 15 万亿 token,上下文窗口最长可达 512,000 token。值得注意的是,较大的模型(8B 和 30B)采用了名为“智能体强化学习”(agentic RL)的训练技术,使模型能够自主探索工具使用和代码执行,而非仅仅依赖静态的指令微调。所有模型均采用 Apache 2.0 许可证发布,允许商业使用和自由修改。

为什么重要

开源模型领域竞争日趋激烈,Meta 的 Llama 系列、Mistral 的模型以及阿里的 Qwen 系列都备受关注。IBM 此次发布的 Granite 4.2 并非简单的参数升级,而是将“智能体能力”作为核心卖点,直接切入当前 AI 应用的热点方向。通过智能体 RL 训练,模型不再局限于文本生成,而是能够主动调用外部工具、编写并执行代码,这使其在自动化任务、数据分析、软件开发等场景中具有更大的实用价值。此外,512K 的上下文窗口使其能够处理超长文档,满足企业级应用的需求。

影响与看点

对于开发者而言,Granite 4.2 的 Apache 2.0 授权意味着可以无顾虑地集成到商业产品中,而三种尺寸的选择也提供了灵活的部署方案。其内置的智能体能力可能降低构建复杂 AI 应用的门槛,例如自动生成代码并执行、与外部 API 交互等。然而,智能体 RL 训练的具体效果仍需实际测试验证,尤其是与专门的代码模型(如 CodeLlama)或智能体框架(如 LangChain)相比,其性能表现尚待观察。此外,IBM 在开源社区的影响力相对有限,Granite 4.2 能否吸引足够的社区关注和贡献,将影响其生态的发展。总体而言,这是一次值得关注的发布,但实际落地效果还需时间检验。