跳到正文
北京时间
原文
Google DeepMind:Blog(RSS)·· 2026-06-11精选AI 评分72

DiffusionGemma:文本生成速度提升4倍的开源扩散模型

DiffusionGemma: 4x faster text generation

AI 导读

Google DeepMind 发布开源实验模型 DiffusionGemma,采用文本扩散技术,突破自回归逐 token 生成方式,每次前向并行生成 256 个 token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存消费级 GPU。在 H100 上达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,速度提升 4 倍。具备双向注意力和自我修正能力,面向内联编辑、代码填充等本地交互工作流,以 Apache 2.0 许可证开放。

推荐理由

DiffusionGemma 虽为实验性质,但它把文本生成从“串行打字机”变成了“并行印刷机”,本地推理速度 4 倍提升,对需要实时交互的开发者是个值得关注的方向。

正文 · AI 翻译

我们最新的开放实验模型在专用 GPU 上可实现最高 4 倍的推理速度提升,并为探索对速度要求苛刻的交互式本地工作流打开了大门。

B

Brendan O'Donoghue

研究科学家

S

Sebastian Flennerhag

研究科学家

今天,我们推出 DiffusionGemma,这是一款探索文本扩散的开放实验模型,文本扩散是一种速度极快的文本生成方法。该模型以 Apache 2.0 许可证发布,是一个 26B 参数的专家混合(MoE)模型,突破了典型自回归大语言模型(LLM)逐个 token 顺序处理的模式,而是同时生成整块文本,在 GPU 上实现最高 4 倍的文本生成速度提升。

DiffusionGemma 基于我们 Gemma 4 系列业界领先的单位参数智能水平,以及前沿的 Gemini Diffusion 研究构建,集成了一个旨在最大化生成速度的新型扩散头。虽然自回归 Gemma 4 模型仍是高质量生产输出的标准,但 DiffusionGemma 专为探索对速度要求苛刻的交互式本地工作流的研究人员和开发者而设计,例如行内编辑、快速迭代以及生成非线性文本结构。

为开发者释放新价值

构建实时交互式 AI 应用的开发者常常受困于本地推理的延迟瓶颈。DiffusionGemma 直面这些挑战,同时带来了几个关键的权衡:

  • 极速推理:通过将解码瓶颈从内存带宽转移到计算,DiffusionGemma 在专用 GPU 上的 token 输出速度最高可提升 4 倍(单张 NVIDIA H100 上超过 1000 tokens/秒,NVIDIA GeForce RTX 5090 上超过 700 tokens/秒)。1
  • 亲民的硬件需求:DiffusionGemma 是一个总参数量为 26B 的混合专家(MoE)模型,推理时仅激活 3.8B 参数;经量化后,它可以轻松装入高端消费级专用 GPU 的 18GB VRAM 限制之内。
  • 双向注意力:每次前向传播并行生成 256 个 token,使每个 token 都能关注其他所有 token。这为行内编辑、代码填充、氨基酸序列或数学图等非线性领域带来了显著优势。
  • 智能自我纠错:模型会迭代地优化自身的输出,能够一次性评估整个文本块,从而实时修正错误。
  • 实验状态与生产建议: 由于 DiffusionGemma 优先考虑速度和并行布局生成,其整体输出质量低于标准 Gemma 4。对于追求最高质量的应用,我们建议部署标准 Gemma 4。

你可以通过微调来提升 DiffusionGemma 在特定任务上的表现。在下面的示例中,Unsloth 对 DiffusionGemma 进行了微调,使其能玩数独——这是一个自回归模型难以完成的任务,因为每个 token 都依赖于未来的 token。DiffusionGemma 的双向注意力让这一任务变得容易得多。

经微调的 DiffusionGemma 解数独。

为什么用扩散模型生成文本?

虽然 AI 研究界多年来一直在探索基于扩散模型的文本生成,但将其应用于大模型始终是一个挑战。DiffusionGemma 通过改变模型使用硬件的方式改变了这一局面。

传统模型的取舍

大多数语言模型就像一台打字机,从左到右逐个生成 token。在云端,这种方式是高效的,因为服务器可以将成千上万的用户请求打包在一起以共享硬件负载。但在本地为单个用户运行时,这种逐词生成的过程会让你的专用 GPU 或 TPU 利用率不足——它大部分时间只是在等待下一次“击键”。

DiffusionGemma 颠覆了这种低效模式。它不再逐词预测,而是同时起草整段 256 个 token 的文本。通过一次性给处理器分配更大块的工作,DiffusionGemma 能充分发挥你的硬件潜力。它把模型推理从一台单线、顺序输出的打字机,升级成了一台同时盖印整块文本的大型印刷机。

Hugging Face 的 DiffusionGemma 文生 3D SVG 演示。逐步生成过程。

这意味着 DiffusionGemma 的加速设计是针对本地和低并发推理场景的。在高 QPS 的云端服务中,自回归模型可以通过部署高效地吃满算力,因此 DiffusionGemma 的并行解码收益递减,反而可能导致更高的服务成本。其吞吐量优势在单个加速器上的低到中等 batch 规模下最为显著。

文本扩散是如何工作的

正如 AI 图像生成器 从视觉噪点开始并迭代精炼 成清晰图片一样,DiffusionGemma 把这一方法应用到了文本上:

  1. 画布: 模型从一块由随机占位 token 组成的画布开始。
  2. 迭代精炼: 模型进行多轮处理,锁定正确的 token,并将其作为上下文线索来精炼其余部分。
  3. 最后润色: 文本收敛为高质量输出。

由于模型可以在生成的同时处理整段内容,它解锁了全新的模型行为模式,例如完美闭合复杂的 markdown 格式,或以近乎实时的速度生成并渲染代码。

立即开始使用

  • 下载权重: 现在即可在 Hugging Face 上获取实验性模型权重(以宽松的 Apache 2.0 许可证发布)。
  • 集成与学习: 在我们的 DiffusionGemma 开发者指南中了解更多。或者深入研究 DiffusionGemma 可视化指南,了解其底层工作原理。
  • 使用你喜爱的开发工具: 使用 MLX、vLLM(集成由 Red Hat 支持)和 Hugging Face Transformers 高效部署该模型。为支持快速实验,我们正在发布一份使用 Hackable Diffusion 的微调教程,这是一个专为可组合性设计的模块化 JAX 工具箱。你还可以使用 Unsloth 和 NVIDIA NeMo 探索微调。此外,对 llama.cpp 的官方支持即将推出。
  • 体验优化后的性能: 我们与 NVIDIA 合作,在整个硬件栈上进行了优化,确保兼容消费级设备(针对 GeForce RTX 5090 和 4090 GPU 进行量化),同时在企业级系统上保持高性能(Hopper 和 Blackwell 上使用先进的 NVFP4 内核),包括用于本地桌面端部署的 NVIDIA DGX Spark 和 DGX Station,以及面向 AI 专业人士的 RTX PRO。对 NVFP4(4 位浮点)的原生支持提升了计算吞吐量,使模型能够以更快的速度运行,且精度几乎无损。
  • 随心试用: 可在桌面端独显上运行,或通过 Gemini Enterprise Agent Platform Model Garden 或 NVIDIA NIM 在云端运行。

来源:Google DeepMind:Blog(RSS) · deepmind.google