英伟达近日宣布其Groq 3 LPX推理芯片全面投产,并宣称在Gemma 4 31B模型上实现了每秒3400 tokens的处理速度,是Cerebras的4倍。然而,这一数字背后隐藏着复杂的算力成本问题,实际性能对比远非表面那么简单。

发生了什么

英伟达官方表示,Groq 3 LPX在运行Gemma 4 31B模型时,吞吐量达到每秒3400 tokens,并以此作为其推理性能的标杆。然而,据The Register报道,要达到这一速度,英伟达需要至少64个Groq 3 LPX加速器协同工作,而Cerebras的解决方案仅需1到2个芯片即可实现类似性能。这意味着,英伟达的“快”是建立在大量硬件堆叠的基础上,其单位算力效率可能并不占优。

此外,Groq 3 LPX在大型混合专家(MoE)模型上的扩展性仍是一个未解之谜。MoE模型因其稀疏激活特性,对推理架构的显存带宽和调度能力要求极高,而英伟达目前尚未公布相关测试数据。

为什么重要

推理速度是AI芯片竞争的关键指标,但单纯比较峰值吞吐量容易误导用户。英伟达的对比方式忽略了硬件数量这一关键变量,而Cerebras凭借其巨大的晶圆级芯片,在单芯片性能上具有天然优势。对于数据中心运营商而言,总拥有成本(TCO)不仅包括芯片价格,还包括功耗、散热、机房空间和运维成本。64个加速器的部署复杂度与1-2个芯片不可同日而语。

此外,Groq 3 LPX的架构设计针对特定模型优化,而实际生产环境中的模型多样,尤其是MoE模型的流行,对推理芯片的通用性提出了更高要求。英伟达在训练市场的霸主地位能否延续到推理市场,仍需观察其架构的适应能力。

影响与看点

对于云服务提供商和大型企业,选择推理芯片时需权衡性能与成本,而非盲目追求峰值速度。英伟达的Groq 3 LPX在特定模型上表现出色,但若需大量部署,其功耗和空间成本可能抵消性能优势。Cerebras则更适合对延迟敏感且需要高吞吐量的场景,但其生态和软件支持尚不如英伟达成熟。

值得关注的是,MoE模型的推理优化将成为未来竞争焦点。Groq 3 LPX能否在MoE模型上保持优势,将直接影响其市场定位。此外,英伟达的CUDA生态和开发者工具仍是其护城河,但Groq的专用架构可能在某些场景下提供更优的性价比。

独立判断:英伟达的“四倍”宣传有营销成分,实际性能对比需考虑硬件数量和总成本。推理芯片的竞争将回归能效比和生态成熟度,而非单一数字。