跳到正文
北京时间
原文
Hugging Face:Blog(RSS)·· 2026-05-23精选AI 评分63

NVIDIA 发布 Nemotron-Labs Diffusion 系列模型,支持三种生成模式

Towards Speed-of-Light Text Generation with Nemotron-Labs Diffusion Language Models

AI 导读

NVIDIA 发布 Nemotron-Labs Diffusion 系列,含 3B、8B、14B 文本模型和 8B 视觉-语言模型(VLM),均采用商用友好的 NVIDIA Nemotron Open Model License 或 NVIDIA Source Code License。模型支持自回归、扩散(逐块并行生成后逐步精炼)和自推测(扩散草拟候选 token 再自回归验证)三种模式。8B 模型平均准确率比 Qwen3 8B 提升 1.2%,扩散模式每次前向传递的 token 数(TPF)达自回归的 2.6 倍,自推测达 6–6.4 倍。模型在 1.3T tokens 上预训练、45B tokens 上微调,代码与模型已发布于 HuggingFace 和 GitHub,推理将获 SGLang 支持。

推荐理由

自推测模式让文本生成速度飙到AR模型的4倍,而且输出质量无损。NVIDIA这次开源的不仅是个新模型,更是一套能直接用在现有流程里的加速方案。

正文 · AI 翻译

1-headline-final

大语言模型(LLM)已成为代码生成、数学问题求解、摘要、文档理解以及许多其他开发者工作流的默认接口。然而在底层,许多 LLM 仍然以同样的方式生成文本:一次一个 token,而每个 token 都依赖于它之前出现的 token。因此,这类模型被称为自回归模型,因为它们会消费自己的输出。

这种自回归(AR)方法取得了极为显著的成功。它训练稳定、服务部署简单,并且是现代语言建模领域大部分进展的功臣。但它也带来一个硬性限制:每一个新 token 都需要一次完整的模型前向传播,而且在计算开始之前,每一个权重都必须从内存中加载。对于构建延迟敏感型应用、运行较小批量规模,或试图更好地利用现代 GPU 的开发者来说,逐 token 生成会让性能白白流失,因为 GPU 的大部分时间都花在了内存操作上,而非计算上。

此外,一旦某个 token 由自回归模型生成,它就是最终结果,这类模型本身并不具备修改先前 token 的能力。因此,错误可能会在生成过程中不断传播。

Nemotron-Labs Diffusion 开辟了一条新路径:扩散语言模型(DLM),其工作方式是并行生成多个 token,然后通过多个步骤迭代地精炼所生成的 token。这些模型不仅能更好地利用现代 GPU 的计算模式,带来显著的运行时性能优势,还能对已生成的 token 进行修订,使其更适合修订现有文本以及处理中间填充(fill-in-the-middle)目标。这种“生成并精炼”的特性还提供了一种内置的推理预算控制方式。通过减少精炼步骤的数量,就可以在运行时降低这些模型的计算需求。

模型、训练配方与技术报告的快速链接

Nemotron-Labs Diffusion 系列包含 3B、8B 和 14B 规模的文本模型,全部在商业友好的 NVIDIA Nemotron Open Model License 下提供,此外还有一款 8B 规模的视觉语言模型(VLM),在 NVIDIA Source Code License 下提供,赋予广泛的研究灵活性。在整个产品线中,NVIDIA 同时发布基础模型和指令微调的聊天变体。NVIDIA 还通过 NVIDIA Megatron Bridge 框架发布了用于训练这些模型的代码。

单一模型中的三种生成模式

Nemotron-Labs Diffusion 围绕一个简单的理念设计:自回归生成与扩散生成不应是彼此独立的模型家族,而应是同一个模型所具备的能力。该模型支持三种生成模式:

自回归模式的运行方式与标准的从左到右 LLM 相同。这保持了与开发者已经熟悉的生成工作流的兼容性。

扩散模式逐块生成,在多个步骤中逐步生成 token。

自推测模式使用扩散来草拟多个候选 token,然后使用自回归解码对它们进行验证。这将扩散式草拟的速度潜力与 AR 验证的可靠性结合在一起。

这种灵活的设计是面向开发者的关键特性,在速度与准确性都至关重要的场景中尤为如此,即便是在批大小不可预测的工作负载,或仅有单个查询(批大小=1)的情况下也是如此。选择所需的推理模式在应用层面几乎无需任何改动,因为这是一个部署时的设置。因此,开发者可以在他们目前使用的模型与 Nemotron-Labs Diffusion 的各种推理模式之间无缝切换,以实现超快的生成速度。

性能亮点

Nemotron-Labs Diffusion 8B 相比 Qwen3 8B 实现了 1.2% 的平均准确率提升。比较以每次前向传播的 token 数(简称 TPF,一种与硬件无关的 token 解码效率衡量方式)来衡量的推理速度,扩散模式达到的 TPF 是 AR 模型的 2.6 倍,而自推测进一步将其提升至线性自推测的 6 倍和二次自推测的 6.4 倍,同时在所评估任务上的准确率相当。

我们如何训练 Nemotron-Labs Diffusion

扩散语言模型多年来一直前景可期,但它们历来存在实际障碍:准确率低于强大的 AR 模型、训练更困难,以及对 KV 缓存的兼容性有限。

近期的工作改变了这一方向。Efficient-DLM 表明,预训练的 AR 模型可以通过继续预训练并将注意力机制改为分块方式,转换为扩散语言模型。这一设计有助于保留 AR 模型的能力,同时实现对 KV 缓存友好的并行解码。

Nemotron-Labs Diffusion 建立在同样的实践洞见之上:为现有的 AR 模型添加扩散能力。该模型以 AR 与扩散联合目标进行训练,使其能够保留在初始 AR 训练期间学到的内容,同时扩散增加了并行起草能力。该模型在来自 NVIDIA Nemotron 预训练数据集 的 1.3T token 上进行了预训练,并使用来自 NVIDIA Nemotron 后训练数据集 的 45B token 进行了额外的监督微调阶段。

通过 SGLang 进行部署与推理

Nemotron-Labs 扩散模型的部署即将在 SGLang 的主分支中得到支持。在撰写本文时,推理支持可通过 GitHub 上的这个 issue 追踪请求获取。

巧妙之处在于,这一集成让你能以三种不同方式服务同一个 checkpoint,只需在算法配置中用一行代码即可选择:

  • 纯自回归 - 设置 ar_mode=true,模型的行为就与任何其他因果 LM 无异。可用作正确性参照,或者当你只想对纯 AR 输出做一次合理性检查时使用。

  • 扩散模式(FastDiffuser)——原始吞吐量的主打亮点。模型每次填充一个 32-token 块,通过迭代去噪完成,并由置信度阈值决定每一步哪些 token 已经“足够好”可以提交。

  • 自推测(LinearSpec)——这个是我们最喜欢的。同一个模型以双向方式起草一个块,然后以因果方式验证它;任何匹配的前缀都会被提交。在温度 0 下,输出相对于 AR 是无损的,但我们在 B200 上、在 speedbench 数据集上达到了约 865 tok/s——大约是同一硬件上自回归基线的 4 倍。

立即开始

Nemotron-Labs Diffusion 将扩散式生成带入了开发者真正可用的形态:开放模型、熟悉的 AR 兼容性、扩散解码,以及自推测加速,全部集成于同一系列之中。借助 Nemotron-Labs Diffusion,开发者获得了一种全新的方式来起草、精炼、验证并加速文本生成,而无需改动自己的应用。

要开始使用,请探索 Nemotron-Labs Diffusion 模型系列,阅读技术报告,并尝试可用的训练配方。

来源:Hugging Face:Blog(RSS) · huggingface.co