文本扩散模型通常需要从头训练,成本高昂。Google DeepMind 的 DiffusionGemma 证明,通过改造现有自回归模型,可以大幅降低训练成本,同时获得并行生成的速度优势。

发生了什么

Google DeepMind 没有从零训练一个新的扩散模型,而是将 Gemma 4 改造为 DiffusionGemma。这一改造过程仅使用了不到原始训练预算的 10%。DiffusionGemma 能够并行生成 256 个 token,而不是像传统自回归模型那样逐个生成,因此实现了约每秒 1500 个 token 的生成速度。然而,在基准测试中,其质量仍然落后于原始的自回归模型,尤其是在推理任务上。

为什么重要

扩散模型在图像生成领域已占据主导,但在文本生成领域,自回归模型仍是主流。原因之一是训练扩散模型需要大量数据和计算资源,通常需要从头开始。DiffusionGemma 的出现打破了这一惯例,通过“改造”现有模型,大幅降低了训练门槛。这不仅意味着更低的成本,还可能让更多研究者和机构能够探索文本扩散模型的应用。此外,并行生成的能力有望提升推理速度,这对于实时应用至关重要。

影响与看点

对于开发者而言,DiffusionGemma 提供了一种新的思路:在已有模型基础上进行轻量级改造,而非重头训练。这可能会加速文本扩散模型的迭代,尤其是在资源受限的环境下。然而,质量上的差距,特别是推理能力的不足,意味着它目前可能更适合对速度要求高、对质量要求相对宽松的场景,如实时交互或大规模内容生成。值得关注的是,未来是否会通过混合方法(如结合自回归和扩散)来弥补质量差距。独立判断:DiffusionGemma 的意义不在于立即取代自回归模型,而在于证明了“改造”路径的可行性,这为文本生成模型的演进开辟了新的可能性。