跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-04-14精选AI 评分80

Nemotron 3 Super:面向智能体推理的开放高效Mamba-Transformer混合专家模型

Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

AI 导读

Nemotron 3 Super是1200亿参数(120亿激活)的Mamba-Attention混合专家模型,首创NVFP4预训练,集成LatentMoE架构与MTP推测解码层优化推理。模型基于25万亿token预训练,经监督微调和强化学习后训练,支持100万token长上下文。相比GPT-OSS-120B和Qwen3.5-122B,推理吞吐量分别提升2.2倍和7.5倍,同时保持相当精度。全系列数据集与模型检查点已在HuggingFace开源。

推荐理由

NVIDIA 用 LatentMoE 和 Mamba 混合架构,把 120B 参数的推理吞吐做到 GPT-OSS 的 2.2 倍,且 agent 能力不输主流前沿模型,对低成本部署智能体是个强信号。

正文 · AI 翻译
摘要

我们描述了 Nemotron 3 Super 的预训练、后训练和量化过程。Nemotron 3 Super 是一个 1200 亿(活跃参数 120 亿)参数的混合 Mamba-Attention 专家混合模型。Nemotron 3 Super 是 Nemotron 3 系列中首个满足以下条件的模型:1)采用 NVFP4 进行预训练,2)利用 LatentMoE(一种新的专家混合架构,针对每 FLOP 精度和每参数精度进行了优化),以及 3)包含用于通过原生推测解码加速推理的 MTP 层。我们在 25 万亿个 token 上对 Nemotron 3 Super 进行了预训练,随后使用监督微调和强化学习进行了后训练。最终模型支持高达 100 万 token 的上下文长度,在常见基准测试上达到了可比的精度,同时与 GPT-OSS-120B 和 Qwen3.5-122B 相比,推理吞吐量分别提升了高达 2.2 倍和 7.5 倍。Nemotron 3 Super 的数据集,以及基础、后训练和量化后的检查点,已在 HuggingFace 上开源。

1 引言

过去几年,基于专家混合架构的大语言模型越来越受欢迎。专家混合架构帮助大语言模型在活跃参数数量低于常规稠密模型的情况下实现更高的精度。与专家混合架构正交,混合 Mamba-Attention 模型在显著提升推理吞吐量方面展现出了潜力。我们在 Nemotron 3 中结合了这两个改进方向。作为 Nemotron 3 系列模型的一部分,我们推出了 Nemotron 3 Super——一个拥有 120 亿活跃参数、1200 亿总参数的专家混合 Mamba-Attention 模型。Nemotron 3 Super 在基准测试精度上达到或优于 GPT-OSS-120B 和 Qwen3.5-122B,同时在 8k token 输入 / 64k token 输出的设置下,推理吞吐量分别提升了高达 2.2 倍和 7.5 倍。

Refer to caption
图1:Nemotron 3 Super与GPT-OSS-120B及Qwen3.5-122B的准确率和吞吐量对比。Nemotron 3 Super在主流评测基准上达到了相当的准确率,但提供了最高的推理吞吐量;在8k输入序列长度和64k输出序列长度下,Nemotron 3 Super的吞吐量分别比GPT-OSS-120B和Qwen3.5-122B高出2.2倍和7.5倍。我们在B200 GPU上使用vLLM和TRT-LLM测量了吞吐量,并为每个模型选用了两个框架中表现更优的一个。对于GPT-OSS-120B,我们使用了MXFP4权重、MXFP8激活值和FP8 KV-Cache;对于Qwen3.5-122B,我们使用了BF16。我们使用OpenHands测试框架来评估SWE-Bench。

Nemotron 3 Super是我们首个采用LatentMoE(latentmoe_tr)的模型——这是一种新颖的MoE架构,在每参数量和每FLOP指标上均优于常规MoE。Nemotron 3 Super还集成了多token预测(MTP),通过推测解码加速推理,同时提升整体模型质量。我们以NVFP4精度预训练了Nemotron 3 Super,证明了低精度下稳定且准确的预训练能力。与Nemotron 3 Nano(nvidia2025nemotron3nanoopen)类似,我们将Nemotron 3 Super的预训练分为两个阶段,共使用25万亿文本token。第一阶段占预训练总量的80%(20万亿token),侧重于多样性和广泛覆盖;第二阶段占预训练总量的20%(5万亿token),侧重于高质量数据和基准准确率。我们的基础模型在准确率上显著优于同等规模的最先进基础模型,例如GLM-4.5-Air-Base(5team2025glm45agenticreasoningcoding)和Ling-flash-Base-2.0(lingteam2025every)。

我们训练 Nemotron 3 Super 时,重点强调了智能体能力。为支持这一目标,我们大幅扩展了强化学习环境的广度、智能体训练数据的数量和质量,以及专注于多步骤工具使用行为的后训练总量。为了有效训练这些多样化的长周期任务,我们对强化学习基础设施的鲁棒性进行了重大改进,实现了大规模异步训练。这种扩展后的智能体训练方案,在软件工程、终端使用以及通用工具使用基准测试中,相较于 Nemotron 3 Nano 带来了显著的性能提升。

我们正在 Nemotron 开发者仓库111https://github.com/NVIDIA-NeMo/Nemotron 上公开分享 Nemotron 3 Super 的训练方案。同时,我们还开源了以下内容:

模型检查点

  • •

    Nemotron 3 Super 120B-A12B NVFP4:后训练 + NVFP4 量化模型

  • •

    Nemotron 3 Super 120B-A12B FP8:后训练 + FP8 量化模型

  • •

    Nemotron 3 Super 120B-A12B BF16:后训练模型

  • •

    Nemotron 3 Super 120B-A12B Base BF16:基座模型

  • •

    Qwen3-Nemotron-235B-A22B-GenRM-2603:用于 RLHF 的 GenRM

  • •

    Nemotron-Pretraining-Specialized-v1.1:一组旨在提升大语言模型在代码概念与算法、形式逻辑、经济学以及多项选择题方面能力的合成数据集。

  • •

    Nemotron-Super-Post-Training-Data:一组针对广泛智能体能力的强化学习环境和 SFT 数据集。

本报告分为三大章节:预训练(第 2 节)、后训练(第 3 节)和量化(第 4 节),每节都详细描述了我们的方法。

2 预训练

在本节中,我们重点介绍 Nemotron 3 Super 120B-A12B Base 的关键特性,详细阐述其混合 Mamba-Attention 专家混合(MoE)架构、NVFP4 预训练、超参数配置、长上下文扩展,以及用于预训练的 25 万亿 token 语料库。我们还将证明,在一整套全面的基准测试中,Nemotron-3 Super 120B A12B Base 相比其他公开的顶尖模型(包括 Ling-flash-Base-2.0 和 GLM-4.5-Air-Base)取得了更优的准确率。

2.1 模型架构

Refer to caption
图 2:Nemotron 3 Super 层模式。与 Nemotron 3 Nano 类似,我们采用了混合 Mamba-Attention 架构,但 Nemotron 3 Super 是首个使用 LatentMoE 层而非标准 MoE 层进行稀疏扩展的模型。
媒体内容 · 前往原文查看
配置 Nemotron 3 Super 120B-A12B 基础模型
总层数 88
模型维度 4096
Q 头数 32
KV 头数 2
头维度 128
Mamba 状态维度 128
Mamba 组数 8
Mamba 头数 128
Mamba 头维度 64
专家隐藏层维度 2688
共享专家中间层大小 5376
每层总专家数 512
Top-(激活专家数) 22
MoE 潜在空间大小 1024
MTP 层(共享权重) 2
表 1:Nemotron 3 Super 架构维度。该模型采用混合 Mamba-2 和 MoE 设计,并配有策略性的全局注意力层,以优化序列建模性能与推理吞吐量之间的平衡。

Nemotron 3 Super 120B-A12B 基础模型将 Nemotron-3 Nano 中引入的混合 Mamba-Attention 混合专家(MoE)架构进行了规模扩展。我们将此基础架构扩展至 1206 亿总参数量,同时将每次前向传播的活跃参数量严格控制在 127 亿(不含嵌入层为 121 亿)。该架构包含三大核心支柱:稀疏 LatentMoE 扩展(§2.1.1)、用于推理加速的多 token 预测(MTP)(§2.1.2),以及周期性混合交错模式(§2.1.3)。

2.1.1 LatentMoE:面向硬件的专家设计,以提升每字节精度

混合专家(MoE)架构已成为在固定推理成本下最大化准确率的一种有前景的方法,它允许模型在保持每个 token 浮点运算次数(FLOPs)不变的同时扩大参数量。现有的 MoE 设计主要受高层稀疏性论证驱动,并针对离线、面向吞吐量的场景进行优化,很少考虑那些对延迟、内存带宽和通信有严格限制的在线部署。虽然每 FLOP 准确率反映了计算效率,但每参数准确率则捕捉了内存占用、内存带宽、路由引发的通信以及分片开销。忽略这些因素可能会产生在总体计算量上看似高效、但在实际中却导致显著低效的架构。

受这些观察的启发,我们从硬件-软件协同设计的角度重新审视了 MoE 设计。通过对现有 MoE 系统在吞吐量-延迟帕累托前沿上的系统分析,结合准确率测量和理论分析,我们识别出当前 MoE 设计中限制每单位推理成本准确率的结构性低效问题。基于此分析,我们提炼出以下高效 MoE 扩展的设计原则:

  1. 1.

    在低延迟服务中,MoE 推理通常受限于读取专家权重的内存带宽成本。每个专家矩阵的大小为 ,其中 是隐藏维度, 是专家 FFN 中间维度;因此,降低此成本需要减小 或 。

  2. 2.

    在面向吞吐量的服务中,分布式 MoE 推理受限于全对全路由。路由通信量与 成正比,其中 是激活专家数量;因此,降低通信开销需要减小 或 。

  3. 3.

    保持模型质量需要保持有效的非线性预算 。为了在不牺牲质量的情况下缓解内存和通信瓶颈, 和 应保持固定。

  4. 4.

    特定任务的有效特征秩 对 的缩减幅度设定了下限;将 降低到此下限以下会导致模型质量崩溃。

  5. 5.

    同时增加专家总数和每个 token 的 top-k 专家数量,可以通过指数级扩展专家组合空间来提升模型质量。

原则 (1)–(3) 表明,隐藏维度是最有希望进行缩减的维度,能够在吞吐量导向和延迟导向两种场景下都获得性能提升,同时不会显著损失精度。原则 (4) 给出了在不导致模型崩溃的前提下,隐藏维度可缩减程度的下界。原则 (5) 指出,增加专家总数和 top-k 专家数量可以提升质量;由于内存带宽和通信开销与隐藏维度呈线性关系,我们可以将隐藏维度扩大一个因子,同时将专家总数和 top-k 专家数量按相同因子缩减,从而在相近的推理成本下获得更高的精度。在这些洞察的指导下,我们开发了 LatentMoE(latentmoe_tr),这是一种 MoE 架构,旨在以与标准 MoE 相近的推理成本实现更高的精度。

Refer to caption
(a) 标准 MoE 架构。
Refer to caption
(b) LatentMoE 架构。
图 3:标准 MoE 与 LatentMoE 对比。在 LatentMoE 中,token 从隐藏维度投影到更小的潜在维度,用于路由和专家计算,从而将路由参数负载和 all-to-all 通信量缩减一个因子。这些节省下来的资源被用于按相同因子同时增加专家总数和每个 token 的 top-k 活跃专家数量,从而在推理成本大致不变的情况下提升模型精度。

LatentMoE 架构如图 3(b) 所示。每个输入 token 首先通过一个可学习的下投影矩阵被投影到更低维度的潜在空间中。压缩后的表示随后被路由到一组扩展的专家,这些专家完全在该潜在空间内运行。专家计算完成后,输出结果被聚合,并通过一个可学习的上投影矩阵投影回原始维度。将路由专家计算和全对全通信转移到潜在空间中,相对于标准 MoE,每个专家的权重负载和通信负载均按比例降低。我们利用这些节省的资源,将专家总数从 [原文未给出具体数字] 增加到 [原文未给出具体数字],并将每个 token 的 top-k 活跃专家数从 [原文未给出具体数字] 增加到 [原文未给出具体数字]。维度的降低抵消了专家数量和 top-k 值的增加,从而在相似的计算和通信预算下实现了更高的模型质量。为保持质量,所有非路由计算——包括路由门控网络、共享专家计算以及非专家层——仍保留在完整的隐藏维度中,因为它们对目标瓶颈的贡献不大。更多细节请参阅 LatentMoE 技术报告 (latentmoe_tr)。

2.1.2 多 Token 预测

Nemotron-3 Super 引入了多 Token 预测(MTP)目标,以提升建模质量和推理效率。与传统的下一个 token 训练不同,MTP 优化模型在每个位置预测多个未来 token(gloeckle2024better; deepseekai2025deepseekv3technicalreport)。这有助于模型学习能够捕捉多步依赖关系和更长距离结构的表示,从而在验证损失和下游基准测试准确率上带来持续改进。

除了质量提升之外,MTP 还实现了原生推测解码。辅助预测头充当内部草稿模型:在推理过程中,它们生成候选续写内容,由主模型在单次前向传播中进行验证。这大幅降低了解码延迟,同时仅引入极少的额外 FLOPs——远低于外部草稿模型所需的计算量。尽管推测解码在小批量场景下尤为有效,但近期研究表明,它也能在更大批量及稀疏 MoE 设置中提升吞吐量(huang2025moesd)。

面向鲁棒自回归草稿生成的设计。

标准 MTP 实现使用独立的预测头,每个头都经过训练以预测固定的偏移量(例如 )。虽然这在训练期间有效,但将推测解码限制在至多 个草稿 token。更长的草稿需要增加 或自回归地重复使用单个经固定偏移量训练的头。

重复使用固定偏移量的头会引入训练与推理之间的不匹配:该头在真实隐藏状态下训练,但在推理时,其条件依赖于自身生成的状态。这种分布偏移通常会导致草稿长度增加时接受率下降。

Nemotron-3 Super 通过在训练期间跨多个 MTP 头共享参数来解决这一限制,从而形成一个暴露于多个偏移量的统一预测头。这种共享权重的设计使预测头在不同预测跨度上得到正则化,并提高了对自回归草稿生成过程中遇到的自身生成隐藏状态的鲁棒性。因此,同一个头可以在推理时递归使用,以生成更长的草稿并保持更稳定的接受行为。虽然接受率会随草稿长度增加而自然下降,但其退化程度远轻于独立训练的偏移量头。这使得推测解码更加高效,而无需引入额外参数或单独的草稿模型。

推测解码性能。

我们使用 SPEED-Bench(speedbenchnvidia)这一专为推测解码设计的基准来评估 MTP 质量。表 2 报告了在固定草稿长度为 7 时的平均接受长度(每步验证接受的 token 数)。Nemotron-3 Super 实现了最高的整体平均接受长度(3.45),在所有领域均优于 DeepSeek-R1,并与 Qwen3-Next 保持竞争力。

图 5 绘制了接受率随草稿 token 索引变化的函数。正如预期,所有模型的接受率都随草稿深度单调递减。然而,Nemotron-3 Super 在每个草稿位置都始终保持着比 DeepSeek-R1 更高的接受率,并且在大多数索引上紧追或超过 Qwen3-Next。值得注意的是,在递归草稿最具挑战性的较大草稿索引(4–7)处,差距变得更加明显。这种行为表明,在更长的推测展开过程中,共享头自回归设计具有更好的稳定性。

总体而言,Nemotron-3 Super 中的 MTP 既改进了表示学习,也提升了解码效率,从而能够在更长的草稿长度下实现更高的接受率,且无需依赖外部草稿模型。这些接受率的提升直接转化为在 Blackwell 硬件上更优的服务效率。如图 5 所示,通过 MTP 增加草稿深度显著改变了吞吐量-延迟帕累托前沿,与禁用 MTP 的基线相比,在任意给定的用户中位延迟下,都能提供更高的每秒聚合输出 token 数(TPS)。

Refer to caption
图 4:在 SPEED-Bench 上使用草稿长度 7 时,按草稿索引划分的 MTP 接受率。
类别 DSR1
Qwen3
Next
Nemotron3
Super
编程 2.99 4.32 3.78
人文学科 2.67 3.07 3.26
数学 2.98 3.89 3.73
多语言 2.83 3.97 4.05
问答 2.63 3.09 3.16
RAG 2.79 3.53 3.78
推理 2.80 3.47 3.59
角色扮演 2.19 2.17 2.82
STEM 2.79 3.37 3.30
摘要 2.59 3.06 3.48
写作 2.41 2.69 2.99
平均 2.70 3.33 3.45
媒体内容 · 前往原文查看
表 2:在 SPEED-Bench 上使用草稿长度 7 时的 MTP 平均接受长度。
Refer to caption
图 5:NVFP4 检查点(TRT-LLM,TP=1,B300 GPU)的总吞吐量与用户吞吐量。比较 MTP 关闭与草稿长度为 1、3 的 MTP。在 SPEED-Bench 的 Throughput-1k 子集上测量,输出 token 数为 1k。

2.1.3 混合交错 MoE 架构与全局锚点

Nemotron 3 Super 采用了混合专家(MoE)架构,旨在最大化推理吞吐量——尤其是在长上下文推理场景中——同时保留大规模密集 Transformer 的建模能力。现代序列模型的主要系统瓶颈在于自注意力层中 KV 缓存的二次方增长。为解决此问题,我们主要使用 Mamba-2 块(dao2024transformersssmsgeneralizedmodels),其在生成过程中保持恒定大小的状态,从而显著降低内存开销和延迟。

这 88 层堆叠遵循一种周期性交错模式,其中 MoE 层与 Mamba-2 块配对。虽然 Mamba 提供了高效的线性时间序列建模,但仍有少量自注意力层被策略性地插入作为全局“锚点”,以实现全 token 交互和跨堆叠的长距离信息路由。这种混合交错模式保留了全局依赖建模能力,同时将大部分计算负载转移到更高效的 Mamba 和稀疏 MoE 组件上。表 1 和图 2 全面总结了混合堆叠的结构参数及具体的交错模式。

注意力层采用分组查询注意力(GQA),包含 32 个查询头和 2 个 KV 头(头维度为 128)。与之前的 Nemotron 模型一致,我们省略了位置嵌入、dropout 和线性层中的偏置项,使用 RMSNorm 进行归一化,并保持未绑定的嵌入和输出权重。此配置支持长达 1M token 的上下文窗口。

稀疏扩展进一步提升了效率。每个 MoE 层仅对每个 token 激活一部分专家(top-22 路由),使得模型总参数量可扩展至 120.6B,同时每次前向传播的活跃参数量维持在 12.7B。

总体而言,线性时间 Mamba 块、稀疏激活的 MoE 能力以及策略性放置的注意力锚点之间的协同作用,使 Nemotron 3 Super 能够提供强大的长上下文性能,同时针对在现代硬件上的实际部署进行了优化。

2.2 NVFP4 预训练

媒体内容 · 前往原文查看
表 3:按层类型划分的精度
层类型 格式 理由
除非另有说明,所有线性层 NVFP4
网络最后 15% BF16 促进大规模训练稳定性
潜在投影层 BF16 策略性地保留为 BF16,因为其对步进时间的影响可忽略不计
MTP 层 BF16 保留多 token 预测能力
QKV 与注意力投影层 BF16 维持少数注意力层的保真度
Mamba 输出投影层 MXFP8 缓解在较小规模下将该层量化为 NVFP4 时观察到的高频下溢问题
嵌入层 BF16

Nemotron 3 Super 采用了 Nemotron 3 白皮书(nvidia2025nvidianemotron3efficient)中详述的 NVFP4 预训练方案进行训练。除非表 3 中另有说明,所有线性层均使用 Transformer Engine 提供的开源 NVFP4 GEMM 内核进行训练,该内核以 cuBLAS 为后端(NVIDIA_TransformerEngine_PR2177),用于前向传播、反向传播和权重梯度 GEMM 计算。该框架根据 nvidia2025pretraininglargelanguagemodels 首次引入的方案,对权重、激活值和梯度执行 NVFP4 量化。权重使用二维(2D)块缩放量化为 NVFP4,以保持前向和反向传播中量化权重的一致性。梯度和激活值则沿 GEMM 归约轴使用一维(1D)块量化为 NVFP4。对权重梯度的输入执行随机哈达玛变换(RHT),并对梯度张量应用随机舍入。NVFP4 格式采用 E2M1 元素格式,包含 16 元素微块、E4M3 微块缩放因子以及二级 FP32 全局缩放。Nemotron 3 Super 展示了在 NVFP4 格式下高达 25T token 的大规模稳定训练能力。

在训练 Nemotron 3 Super 的过程中,我们观察到零值权重梯度元素的数量有所增长,并对其根本原因进行了调查,以验证训练的健康状况。在某些专家层中出现了幅度模式,其特征是 FC1 输出通道的范数与对应的 FC2 输入通道的范数趋近于零(图 6)。到预训练结束时,零值权重梯度元素占总参数的 7%,似乎与这些幅度模式相关。我们认为 NVFP4 量化增加了权重梯度中真正零值的出现频率,而这些零值原本在 BF16 或 MXFP8 下更容易被表示。当这些层使用 NVFP4 训练时,低范数通道的衰减速度可能更快。

Refer to caption
图 6:Nemotron 3 Super 专家层权重中的通道幅度模式。随着训练的进行,模式逐渐显现。上图:早期层路由专家 FC1 权重矩阵,分别在 0.5T token 和 23T token 时的情况。下图:早期层路由专家 FC2 权重矩阵,分别在 500B token 和 23T token 时的情况。FC1 的低范数输出通道与 FC2 的低范数输入通道对齐。
Refer to caption
图 7:Nemotron 3 Nano 上的零值权重梯度元素数量。左图:已发布的 Nemotron Nano 3 模型(nvidia2025nemotron3nanoopen),使用 BF16 训练至 25T token。右图:消融实验,使用 BF16 和我们的 NVFP4 方案训练至 1T token。在 1T token 时,NVFP4 模型达到的零值权重梯度数量与 BF16 模型在 25T token 时相近。在 0.5T token 时从 NVFP4 切换回 BF16,会导致零值权重梯度恢复到基线水平。BF16 中小幅度梯度(<1e-12)的高出现率表明,NVFP4 量化将本已很小的数值下溢为零。

我们对比了在 BF16 和 NVFP4 格式下、使用相同 1T 模型 token 训练的 Nemotron 3 Nano 模型(nvidia2025nemotron3nanoopen),发现在相同 token 量下,NVFP4 预训练产生的零值权重梯度数量大约是 BF16 的 3 倍。当部分训练的 NVFP4 模型切换回 BF16 后,零值权重梯度的数量恢复到了基线水平。BF16 模型中仍包含许多小幅度梯度(<1e-12),但 NVFP4 量化会将这些值下溢为零(图 7)。我们从路由专家层中采样了权重、激活和梯度张量,观察到在 500B token 时,FC2 的 dgrad 中存在高比例的下溢,这主要是因为二维权重量化块跨越了高幅度和低幅度通道。FC2 中 dgrad 的下溢通过梯度反向传播,在 FC1 的 wgrad 中产生零值。在 750B token 时,我们观察到 FC1 的 fprop 中存在高比例下溢,进而在 FC2 的 wgrad 中产生零值(图 8)。1T token 的 NVFP4 模型表现与训练时间更长的 BF16 模型相似。在 10T token 后,以 BF16 训练并发布的 Nemotron 3 Nano 模型(nvidia2025nemotron3nanoopen)达到了与训练至 1T token 的 NVFP4 模型相似的零值权重梯度元素数量(图 7),并且对早期专家层权重矩阵的检查揭示了相似的通道幅度模式。这些关于 Nemotron 3 Nano 架构的结论,为理解 Nemotron 3 Super 中的通道幅度模式以及零值权重梯度元素的增长提供了洞见。

Refer to caption
图 8:Nemotron 3 Nano 中零元素权重梯度的来源,按路由专家层在层深度上的递增顺序展示。数据为某一层索引中所有路由专家的平均值。上图:在 500B token 处采样的张量。FC1 的零值权重梯度百分比高于 FC2,且几乎完全归因于 FC2 的 dgrad 下溢。下图:在 750B token 处采样的张量。FC1 和 FC2 的零值权重梯度百分比同样高。FC1 中的零值权重梯度归因于 FC2 的 dgrad 下溢。FC2 中的零元素权重梯度主要归因于 FC1 的 fprop 下溢,FC2 的 wgrad 下溢贡献较小。

继我们在 NVFP4 预训练方面的前期工作(nvidia2025pretraininglargelanguagemodels)之后,我们评估了在学习率退火之前将所有张量切换至更高精度是否会对 Nemotron 3 Super 有益。我们在 19T token(退火前 1T token)处将所有张量提升至 MXFP8,并继续训练至 20.6T token。虽然这改善了损失曲线,但在下游任务准确率上并未带来提升(图 9)。因此,最终的 Nemotron 3 Super 模型在整个 token 训练范围内均采用我们的 NVFP4 方案进行预训练。

Refer to caption
图 9:将网络精度切换至 MXFP8 后下游任务评估准确率的提升情况。大于零的值表示准确率相较于 NVFP4 模型有所提升。在 MXFP8 下训练后,所有下游任务评估指标均未表现出持续提升。

2.3 预训练数据

2.3.1 数据

在此,我们描述自 Nemotron 3 Nano(nvidia2025nemotron3nanoopen)以来,我们在预训练中新增的几个数据集。我们将在 HuggingFace 上以 Nemotron-Pretraining-Specialized-v1.1 的名称发布这些数据集。

2.3.2 合成代码概念

为了提升 Python 问题解决能力,我们通过合成方式生成了一个包含 Python 问题与解答的数据集。利用从 Nemotron-Pretraining-Code 数据集和 GPT-OSS-120B 中整理出的、涵盖数千个编程概念的分类体系,我们从 HumanEval 基准数据集(chen2021evaluatinglargelanguagemodels)中提取了高级编程概念。在去除提取出的分类表示中的重复项后,我们总共收集了 91 个概念。

利用这些提取出的概念,我们使用 GPT-OSS 20B 进行了开放式生成,以生成测试这些概念的 Python 编程问题,并指示它生成带有描述性函数名称以及函数文档字符串中问题描述的问题。为了在预训练规模下生成这些问题,我们每次生成最多组合四个概念,并且每组概念最多生成五个问题。这总共产生了大约 1400 万个问题。

在问题生成之后,我们使用 GPT-OSS 120B 为每个生成的问题生成了五个独立的解答。为了避免使基于这些数据训练的模型倾向于生成冗长的解答,我们指示 GPT-OSS 120B 将其解答限制在最多 60 行。对于每个问题,我们生成五个解答,并在获得大约 2300 万个问题-解答对后停止生成。

作为生成该数据集的最后一步,我们对生成的“问题-解决方案”对进行了彻底清洗。清洗包括以下步骤:我们检查 GPT-OSS-120B 是否未包含 GPT-OSS-20B 生成的原始问题中未指定的额外导入语句。所有不满足此条件的解决方案均被丢弃。我们通过仅解析 GPT-OSS-120B 提供的解决方案,并将其附加到 GPT-OSS-20B 生成的问题上,来形成最终的“问题-解决方案”对。我们发现 GPT-OSS-120B 经常修改原始问题,而这一步骤确保了我们保持了原始问题生成提示词中规定的所需格式。我们通过生成抽象语法树(AST)来检查最终的“问题-解决方案”对是否为有效的 Python 代码。如果最终函数未通过最终的 AST 检查,则将其丢弃。经过上述清洗流程,我们最终得到了构成该数据集的 1500 万个问题。

2.3.3 合成无条件算法

为了创建此数据集,我们使用 Qwen3-235B-A22B(基座模型)和 gpt-oss-120b 生成了算法类 Python 问题。我们使用了极简的提示词——例如“写一个函数”、“写一个 Python 函数”或“写一个供学生解决的编程问题及其解决方案”——并可选地指定了难度级别(简单、中等或困难)。为确保多样性和质量,我们提示 gpt-oss-120b 重写这些样本以处理边界情况、添加单元测试,并以多种方式重新格式化输出。

在另一个变体中,我们指示 gpt-oss-120b 生成 LeetCode 风格的问题和答案,同样随机选择难度级别。我们还使用 gpt-oss-120b 来评估解决方案的正确性,如果发现不正确,则对其进行修正。总体而言,这种近乎无条件的提示方式确实导致了较高的重复率。为解决此问题,我们发现基于 gpt-oss-120b 为每个问题生成的约 5-8 个词的简短标题进行去重是有效的。

所有样本均按以下方式针对 HumanEval(chen2021evaluatinglargelanguagemodels)、MBPP(austin2021programsynthesislargelanguage)、CRUXEval(gu2024cruxevalbenchmarkcodereasoning)和 LiveCodeBench(jain2024livecodebench)进行了去污染处理:首先,移除与这些基准测试中完全匹配的解答。其次,我们使用 Qwen3-Embedding-0.6 对问题(Problem)和解答(Solution)进行编码,并过滤掉与任何基准测试相似度超过 0.8 的数据。

尽管该数据集按通常的预训练标准来看规模很小(0.2B 个模型 token),但我们相信它有助于教授诸如边界情况处理和程序执行推理等编码实践。证据是,在将这批数据集添加到 25T 模型 token 预训练的最后 100B 模型 token 重做阶段后,Nemotron 3 Nano 基础检查点在 HumanEval、MBPP 和 CRUXEval-O 上的得分提升了 1-2 个百分点。

2.3.4 合成经济学

我们根据一份精选列表,生成了涵盖多种格式的多样化经济学选择题,包括完形填空、计算、句子完成和多项选择,涉及微观经济学、宏观经济学和计量经济学中的关键主题和术语(例如,“统计推断与假设检验——第一类错误”和“通货膨胀与价格水平——通货膨胀率”)。对于每个主题-术语对,我们使用 Qwen3-235B-A22B-Thinking-2507 生成了多个问题,每个问题都附带详细、逐步且格式良好的解答。为了增强多样性,我们进一步提示模型以初始输出为参考,创建全新且原创的问题。每个问题-解答对都经过了基于模型的验证,以确保其清晰性、无歧义性、可解性和准确性。

2.3.5 合成形式逻辑

我们综合构建了一套形式逻辑问题及其解答集,涵盖多项任务,例如自然语言与谓词逻辑或命题逻辑之间的互译、条件命题前件的推导,以及利用间接真值表或完全真值表求解逻辑问题。我们通过向提示词中引入随机角色、字母和/或逻辑连接词(即,, , , , ),为生成的场景、前提和公式引入了多样性。我们使用 Qwen3-235B-A22B-Thinking-2507 生成并评估了这些问题及其解答。

2.3.6 合成多项选择题

我们通过从 MMLU 辅助训练集(hendryckstest2021)进行自举构建了一个多项选择题(MCQ)数据集,该训练集汇集了来自 ARC(allenai:arc)、MC_TEST(richardson-etal-2013-mctest)、OpenBookQA(OpenBookQA2018)和 RACE(lai-etal-2017-race)等来源的辅助多项选择题数据。从每个种子问题出发,我们通过提示 Qwen3-235B-A22B(yang2025qwen3technicalreport)生成了多个遵循相同任务格式和难度水平的相似问题,以及相应的答案选项。在第二阶段,我们提示 DeepSeek-V3(deepseekai2025deepseekv3technicalreport)模型通过选择答案并提供支撑其选择的知识或上下文推理来解答每个生成的问题。为提高答案的可靠性,我们针对每个问题使用不同的随机种子采样了多个独立的解答生成结果。随后,我们对生成的答案进行多数投票,以确定最一致的选项,仅保留最终答案与多数结果一致的样本,并剔除不一致或不正确的实例。

使用这一流程,我们生成了约 350 万个 MMLU 风格的多选题样本(约 16 亿个模型 token),并为其补充了显式的相关知识或推理轨迹。我们通过消融实验评估了这些数据的影响:在 Nemotron-Nano-V3(nvidia2025nemotron3nanoopen)24.9T 模型 token 检查点的基础上,额外用 1000 亿个模型 token 进行持续训练,其中 10 亿个模型 token 来自生成的 MMLU-aux-train-SDG 数据。结果显示,在大多数基准测试上均取得了持续提升:MMLU 从 77.22 提升至 77.51,“MATH Level 5”从 78.55 提升至 79.05,AIME-2024 从 53.3 提升至 56.7,MBPP 从 74.8 提升至 75.2。其他基准测试的表现基本保持稳定,仅有微小波动,这表明合成的多选题数据主要增强了数学和结构化推理能力,且未在其他方面引入性能回退。

2.3.7 数据混合与排序

我们采用了 Nemotron 3 Nano 数据混合方案,如(nvidia2025nemotron3nanoopen)所述。我们的预训练语料涵盖 16 个高级类别。其中最大的组成部分是网络爬取数据,我们按照 Nemotron-CC 分类体系(su2024nemotroncctransformingcommoncrawl)将其划分为五个基于质量的组别:crawl-medium、crawl-medium-high 和 crawl-high,分别代表质量逐步提升的爬取数据,以及它们的合成版本 syn-crawl-medium-high 和 syn-crawl-high,这些合成数据由经过筛选的网络文档生成。除网络爬取数据外,混合数据还包括数学(karimi2025nemotronccmath;akter2024mindmathinformedsynthetic)、维基百科、代码、Nemotron-CC-Code、学术文本、Crawl++、多语言数据、finepdfs(kydlicek2025finepdfs)以及合成的 SFT 风格数据集。SFT 风格数据进一步划分为 general-sft、stem-sft 和 code-sft。作为 SFT 风格组件的一部分,我们将以推理为重点的数据集纳入预训练,这基于先前研究证明其有效性的发现(akter2026frontloading)。Crawl++ 包含 OpenWebText、BigScience(laurencon2023bigsciencerootscorpus16tb)和 Reddit 数据集。

数据混合旨在平衡多样性与质量:在混合过程中,估计质量相近的数据源被赋予相似的权重,而质量更高的数据集则获得比例上更大的权重。关于数据集质量估计和混合构建的更多细节见 (feng2024maximizedataspotentialenhancing)。我们采用了 (feng2024maximizedataspotentialenhancing) 工作中提出的两阶段课程。在第一阶段,混合数据强调数据多样性,以促进广泛的覆盖面和泛化能力。在第二阶段,混合数据转向以高质量来源(例如维基百科)为主,以优化模型性能。向第二阶段的转换发生在总训练 token 的 80% 处。每个阶段使用的具体混合数据如图 10 所示。

Refer to caption
(a) 第一阶段的数据混合。
Refer to caption
(b) 第二阶段的数据混合。
图 10:预训练每个阶段的数据混合。

2.4 超参数

Nemotron 3 Super 120B-A12B Base 的预训练采用了 Warmup-Stable-Decay (WSD) (hu2024minicpm) 学习率调度策略,总训练 token 数为 25 万亿。学习率在前 2000 亿个 token 期间进行预热,达到峰值 。在经历一段持续稳定的平台期后,我们对最后 5 万亿个 token 实施了负平方根衰减调度,将学习率退火至最小值 。

我们使用了 AdamW (loshchilov2017decoupled) 优化器,权重衰减为 0.1,动量系数为 和 。模型训练的序列长度为 8,192,批次大小为 3,072 个序列,因此每个批次大约包含 2517 万个 token。

该架构采用了混合 Mamba-MoE 设计,包含专家混合 (MoE) 层,共有 512 个专家,并采用 top-22 路由机制 ()。我们使用了 sigmoid 路由器评分函数,并辅以专家偏置。为确保在 1206 亿参数中专家得到公平利用,我们采用了无辅助损失负载均衡策略 (wang2024auxiliary; deepseekai2025deepseekv3technicalreport),更新率为 ,并配合使用系数为 的标准负载均衡损失 (lepikhin2020gshard)。

此外,我们采用了损失缩放因子为 0.3 的 MTP 目标。为了在大规模训练中最大化计算效率与训练稳定性,执行过程使用了 BF16 与 NVFP4 的混合精度方案。

2.5 跟踪合并评估

在第 2.4 节所述的 WSD 学习率调度稳定阶段,学习率保持恒定,而各个训练后的检查点在逐步骤的基准测试性能上存在噪声波动。借鉴近期关于权重空间合并的研究(wortsman2022modelsoup; tian2025wsm; ling2025foundation),我们应用检查点合并(对近期检查点的滑动窗口进行加权平均)来生成更强的模型质量读数,而无需专门的学习率衰减运行。在传统的预训练工作流程中,评估中间检查点的模型质量需要专门的衰减运行;检查点合并消除了这一成本。对于与我们类似的调度方案,节省的计算量可达 T 个 token(例如,避免了 1.5T 和 0.5T 处的运行),约占预训练总 FLOP 预算的相应比例。

遵循 tian2025wsm 的方法,我们使用负平方根衰减模拟来计算合并系数,检查点每迭代次数保存一次(以我们的全局 batch size 计算,对应 B 个 token)。我们在预训练过程中评估了 125B、250B 和 500B token 的滑动合并窗口。平均而言,在一套包含 12 个基准测试(MMLU-Pro、MMLU、HumanEval、HumanEval+、MBPP、MBPP+、GSM8K、MATH-500、RACE、ARC-Challenge、HellaSwag、WinoGrande)的测试套件中,最佳合并结果在未加权平均分数上始终比对应的训练后检查点高出 2–4 分。由于合并相对于训练而言计算成本低廉,我们可以在每个检查点评估所有三个窗口并选出最佳结果。图 11 报告了在完整的 25T token 训练过程中,这种三选一的最佳合并结果与训练后检查点的对比情况。

Refer to caption
图 11:在预训练过程中,训练检查点与最佳离线检查点合并方法在 12 个基准测试上的平均准确率对比。在稳定学习率阶段,离线合并方法带来了持续 2–4 个百分点的提升。在学习率衰减阶段(阴影区域),随着训练检查点从实际学习率退火中获益,两者差距逐渐缩小。

在最后 5T token 的学习率衰减阶段(从 20T 到 25T token),合并检查点与训练检查点之间的差距显著缩小,到训练结束时,两条评估曲线基本重合。tian2025wsm 报告称,将合并与衰减相结合相比单独使用合并并无额外收益,因此这种趋同是预期之内的。原始的 WSM 结果更进一步,显示基于合并的读取结果超过了经过衰减训练的检查点。在 Nemotron 3 Nano 规模架构(30B-A3B)上的实验中,当模拟短(B)衰减窗口时,我们能够复现这种增益。然而,在 1T 和 1.5T 合并时间跨度上的直接比较显示,与经过衰减训练的检查点相比并无改善。

我们的结论是,离线检查点合并似乎在较短的退火时间跨度下最为有效。这与 ling2025foundation 的研究结果一致,他们采用了相对较短的衰减计划并报告了基于合并的改进,而与此处使用的长得多(5T)的衰减形成对比——在长衰减下,经过训练的衰减能够匹配或超越基于合并的读取结果。最终为下游对齐而选定的基础模型检查点本身就是一个 500B 的合并结果;即使在完整的衰减计划下,短时间跨度的合并仍然具有实际用途。话虽如此,我们的实验仅探索了一种合并方案(负平方根)和固定的检查点粒度;其他系数方案、更细粒度的检查点窗口,或针对更长衰减时间跨度定制的合并策略,仍有可能恢复在较短时间跨度下观察到的增益。按基准的详细分解见附录图 17。

2.6 长上下文扩展

与 Nemotron 3 Nano 类似,我们在预训练末尾增加了长上下文阶段(LC-Phase)。在长上下文阶段,我们进行了连续预训练(CPT),使基础模型具备长上下文能力。我们使用了恒定学习率和全局批次大小 16。我们采用 64 路上下文并行、2 路张量并行和 64 路专家并行,在 GB200 GPU 上进行训练。我们复用了 Nemotron 2 和 3 Nano 的长上下文文档问答数据集。在长上下文阶段的数据混合中,我们将文档问答数据分配了 20% 的比例,其余 80% 为降采样后的阶段 2 数据。我们首先在 1,048,576(1m)上下文长度上进行了连续预训练。该阶段持续了 340 亿个 token。随后,我们增加了另一个阶段,交替在 1m 和 4k 序列上进行训练,以减轻我们在数学相关基准测试中观察到的轻微影响。第二阶段持续了 170 亿个 token。

2.7 基础模型评估

媒体内容 · 前往原文查看
任务 指标 N-3-Super Ling-flash GLM-4.5
120B-A12B-Base base-2.0 Air-Base
通用知识
MMLU 5-shot, acc 86.01 81.00 81.00
MMLU-Pro 5-shot, CoT EM 75.65 62.10 58.20
AGIEval-En 3/5-shot, CoT EM 77.92 61.70 62.40
GPQA-Diamond 5-shot, CoT EM 60.00 36.00 23.20
数学
GSM8K 8-shot, EM 90.67 90.75 82.60
MATH 4-shot, EM 84.84 63.80 50.36
MATH Level 5 4-shot, EM 70.00 39.80 26.30
AIME 2024 pass@32 53.33 30.00 20.00
代码
HumanEval 0-shot, pass@1 n=32 79.40 70.10 76.30
MBPP-Sanitized 3-shot, pass@1 n=32 78.38 77.30 77.50
常识理解
ARC-Challenge 25-shot, acc_norm 96.08 94.80 93.90
HellaSwag 10-shot, acc_norm 88.97 84.69 87.70
OpenBookQA 0-shot, acc_norm 50.20 47.00 48.60
PIQA 0-shot, acc_norm 85.47 84.00 84.22
WinoGrande 5-shot, acc 78.93 78.37 83.82
阅读理解
RACE 0-shot, acc 91.00 90.10 89.50
多语言
MMLU Global Lite 5-shot, avg 85.72 74.94 79.25
MGSM 8-shot, avg 87.47 82.73 80.33
长上下文
RULER 64K 0-shot 92.26 72.12 80.26
RULER 128K 0-shot 88.26 52.03 61.70
RULER 256K 0-shot 84.56 - -
RULER 512K 0-shot 82.49 - -
RULER 1M 0-shot 71.00 - -
表 4:Ling-flash-base-2.0、GLM-4.5-Air-Base 和 Nemotron Super 120B-A12B Base 的对比。最佳结果以粗体标出。

除非另有说明,所有评估结果均通过 Nemo Evaluator SDK333https://github.com/NVIDIA-NeMo/Evaluator 和 NVIDIA 基于 LM Evaluation Harness444https://github.com/EleutherAI/lm-evaluation-harness 的开源容器收集。为确保可复现性,评估设置的更多详情可在 Nemo Evaluator SDK 的示例文件夹555https://github.com/NVIDIA-NeMo/Evaluator/tree/main/packages/nemo-evaluator-launcher/examples/nemotron/nemotron-3-super 中找到。用于评估的、通过 NVIDIA Nemo Evaluator SDK 打包的 LM Evaluation Harness 开源容器可在此处666https://catalog.ngc.nvidia.com/orgs/nvidia/teams/eval-factory/containers/lm-evaluation-harness 获取。该容器基于 LM Evaluation Harness 构建,并为了公平性对所有模型应用了以下更改:

  1. 1.

    对于数学推理,我们使用贪心解码评估 GSM8K 和 MATH(cobbe2021trainingverifierssolvemath; hendrycks2021measuringmathematicalproblemsolving)基准测试。我们还特别将 MATH 基准测试中的竞赛级别部分标注为“MATH Level 5”。此外,我们报告了在 AIME-2024 上的表现。我们使用 Math-Verify777https://github.com/huggingface/math-verify 对所有生成结果进行评分。

  2. 2.

    对于代码任务(HumanEval(chen2021evaluatinglargelanguagemodels)、MBPP(austin2021programsynthesislargelanguage)),我们在零样本设置下评估 EvalPlus 变体,并对生成结果进行清理(Liu_Is_Your_Code_2023)。我们根据每个提示词 32 次生成来估算结果。

  3. 3.

    通用推理基准测试(OpenBookQA(mihaylov2018suitarmorconductelectricity)、PIQA(bisk2019piqareasoningphysicalcommonsense)、Hellaswag(zellers2019hellaswagmachinereallyfinish)、Winogrande(sakaguchi2019winograndeadversarialwinogradschema))保持不变,但 ARC-Challenge(Clark2018ThinkYH)除外,在该测试中我们同时呈现所有选项,类似于 MMLU(hendrycks2021measuringmassivemultitasklanguage)。

  4. 4.

    对于多语言能力,我们评估 MGSM(shi2022languagemodelsmultilingualchainofthought)(8-shot,原生 CoT)和 Global MMLU-Lite(singh2024globalmmluunderstandingaddressing)。

  5. 5.

    在长上下文能力方面,我们使用每项任务 100 个样本对 RULER(hsieh2024ruler)进行了评估。

Nemotron 3 Super 120B-A12B Base 模型与 Ling-flash-Base-2.0 和 GLM-4.5-Air-Base 的准确率对比结果如表 4 所示。

3 后训练

我们遵循与 Nemotron 3 Nano 相同的总体方案,但更加强调智能体任务。图 12 展示了该流程的概览。我们从监督微调(SFT)阶段(§3.1)开始,随后进入三阶段强化学习阶段——RLVR、SWE-RL 和 RLHF(§3.2)。最后,我们以 MTP 修复阶段收尾。

在 SFT 阶段,我们扩展了训练数据混合,以覆盖更广泛的智能体框架和交互场景。我们还显著改进了强化学习基础设施,使其能够在数千个 GPU 上进行可靠的大规模异步训练。该基础设施使我们能够:(1)在 21 种不同的环境中进行训练,提升跨任务的鲁棒性;(2)在长周期 SWE 任务上进行训练,增强在真实智能体场景中的多步推理和问题解决能力。

Refer to caption
图 12:Nemotron 3 Super 后训练流程概览。

3.1 监督微调

对于 Nemotron 3 Super 的 SFT,我们专注于提升数据集质量和多样性。特别是,我们扩大了智能体数据集的规模,并提高了其在整体 SFT 数据混合中的占比。对话模板与 Nemotron 3 Nano 保持一致。此外,我们增加了低难度推理模式,让用户能进一步控制推理长度。我们发现,单阶段 SFT 会导致长输入短输出场景的性能明显下降。因此,我们采用了双阶段 SFT 流程:第一阶段侧重于从 token 级监督中学习,并诱导出强推理行为;第二阶段则切换为逐对话归一化,以防止长输出主导损失函数,从而在保留推理能力的同时恢复长输入短输出的性能。具体描述如下:

SFT 目标与两阶段损失

对于一个包含多个对话的打包全局批次,设 表示对话 的输出 token 位置集合, 为其输出 token 数量。使用 token 级负对数似然 ,我们采用:

阶段一:token 级别(全局)平均。

我们最小化打包后的全局批次中所有输出 token 的平均损失:

(1)

这相当于将所有对话的输出 token 对数概率相加,再除以输出 token 的总数。

阶段二:样本级别平均。

然后,我们切换为按对话归一化的损失,并在各对话之间进行等权平均:

(2)

该阶段通过先按每个对话自身的输出 token 数量进行归一化,再在批次内进行平均,从而减少长输出的主导效应。

对于阶段一,我们使用 256k 序列长度打包、全局批次大小 64、恒定学习率以及 30k 预热样本进行 SFT。对于阶段二,我们使用 512k 序列长度打包,并包含长度高达 512K 的长上下文数据,全局批次大小为 32,采用恒定学习率。

SFT 期间的 MTP

我们继续使用预训练中相同的共享权重 MTP 头来训练 Nemotron 3 Super,以保留多步预测的精度优势以及投机解码带来的推理性能提升。具体来说,我们训练了两个共享参数的 MTP 层,并使用基于每个 token 损失和 0.3 缩放因子计算的缩放辅助损失来优化组合目标。

3.1.1 数据

我们复用了 Nemotron 3 Nano SFT 数据集中的以下数据集:Chat、Infinibyte 和 Formal Proofs。我们使用新的教师模型(DeepSeek v3.2、Kimi K2)刷新了以下数据集:Competition Math、Competition Code、Conversational Tool Use、Multilingual、Science。下面介绍新增或经过大幅修改的 SFT 数据集。

软件工程。我们整理了一个源自真实 GitHub 问题的编程任务数据集,用于训练 Nemotron 3 Super,使其具备自主软件工程能力,包括代码探索、任务跟踪、问题复现和漏洞修复。我们使用了来自 SWE-Gym (pan2025trainingsoftwareengineeringagents)、R2E-Gym (jain2025r2egymproceduralenvironmentshybrid) 和 SWE-rebench (badertdinov2025swerebenchautomatedpipelinetask) 数据集中的问题及容器化执行环境。对于 R2E-Gym,我们使用 Qwen3-Coder-480B-A35B-Instruct 重新生成了问题陈述。我们以 Qwen3-Coder-480B-A35B-Instruct 作为教师模型,从 OpenHands 智能体框架中提取了轨迹。

智能体编程。

Refer to caption
图 13:智能体命令行界面数据集构建与训练流程

随着智能体命令行界面(CLI)工具的出现,软件开发领域发生了重大转变,从 2021–2023 年的“自动补全”时代迈入了自主执行的新阶段。除了 Claude Code、OpenCode 和 OpenAI 的 Codex 等框架的显著改进外,模型现在能够作为活跃的数字协作者运行,具备多步推理、长周期执行和端到端任务编排的能力。

我们建立了一组基础种子任务,旨在复现智能体命令行界面中常见的用户发起操作。请参考图13,其中我们讨论了完整的流程。我们利用NeMo Data Designer(nemo-data-designer)生成了约2万个查询,这些查询源自对这些环境中通常执行的24种不同行为的分类。随后,我们采用GPT-OSS 120B(openai2025gptoss120bgptoss20bmodel),在“大语言模型作为评判者”框架下,过滤掉那些涉及已有代码库或对现有文件进行修改的任务。这种缓解措施确保了模型不会在空目录中尝试修改操作——这种情况在失败的执行周期中经常导致冗余且耗尽的工具调用。最终得到的数据集包含约1.5万个专注于直接解决方案合成的任务。为了进一步增强生成输出的多样性,我们将每个任务与一份补充性的Markdown规范(相当于AGENTS.md文件)配对。这些文档施加了额外的约束和架构要求,有效缩小了设计空间,并迫使智能体提供更复杂、更多样化的解决方案。

由于我们移除了所有需要预先存在代码库的任务,我们从 SWE 任务中补充了约 3000 道题目,这些题目具有挑战性,且附带了预先存在的代码仓库和特定的 Git 提交哈希值。我们在现有问题描述之前应用了一个简单的提示词,说明执行环境中未安装该库,因此应避免执行单元测试。这是一个经过深思熟虑的决定,旨在大幅减少支持每个 SWE 任务基于样本容器化执行所需的工程工作量,减少工具调用次数,并避免因多轮单元测试执行而产生的大量工具输出。这进一步放宽了对智能体解决该问题的限制,因为没有任何针对 SWE 的提示词来引导智能体完成任务。最后,我们使用一个包含 100 个细粒度任务的分类体系(这些任务通常是用户请求的常见任务)作为种子,合成了 1 万个 Web 开发任务,并应用 LLM-as-a-Judge 来剔除那些需要预先存在代码仓库的任务。我们对这些任务不施加任何限制,仅提供一个 Node.js 环境,并期望智能体自行设置并安装所有依赖项和插件。

应用这些任务集,我们通过记录高性能、开源智能体大语言模型(如 Qwen-3-Coder-480B 和 Minimax M2.5)与各种 CLI 环境(例如 Codex、OpenCode、Qwen Code CLI 和 Stirrup)的交互,从中进行知识蒸馏。这些交互轨迹随后被过滤,并标准化为带有各种工具定义的 OpenAI 标准消息格式,用于大规模 SFT,以有效地将智能体操作知识嵌入到模型中。对于每个智能体 CLI,我们研究其中存在且常用的各项能力。我们应用相同的任务集来针对不同的能力,例如智能体技能、工具限制(仅限 bash 执行)、向用户提问澄清、单步和多步规划、静态和动态多轮对话以及并行工具调用,具体取决于特定 CLI 是否能够支持这些能力。

长上下文。我们通过更全面的合成数据流水线,扩展了来自 Nemotron 3 Nano 的长上下文 SFT 数据集。为了提升长上下文多文档推理能力,我们利用预训练混合数据中的长序列构建了一个合成 SFT 数据集,其中包含书籍、论文、财务报告、代码仓库等内容。我们首先按主题/领域对这些文档进行聚类,并将相关文档拼接起来,以达到目标序列长度,例如 128K、256K 或 512K 个模型 token。对于每个长上下文样本,我们使用一个大语言模型生成一个或多个问答对。提示词要求问题涉及跨文档或跨章节的检索,确保信息分散而非局部集中。它严格强制进行多跳推理,要求至少包含 4 到 7 个不同的检索或推理步骤。这些步骤需要计算或逻辑处理,防止简单的复制粘贴,并且通常包含明确的格式指令。接下来,我们为每个上下文-问题对生成 8 条独立的推理轨迹。我们应用语义多数投票来对答案进行分组,可以通过精确匹配或使用大语言模型评判器来实现。从得到的多数分组中,我们选择包含最短推理轨迹的答案。此外,我们生成了七个合成推理任务,以提升模型按顺序、从左到右处理上下文的能力。具体来说,合成片段(使用 Qwen3-235B-A22B-Thinking-2507 生成)被拼接在一起形成长输入上下文。思考轨迹通过串联基于规则的推理步骤来构建,每个步骤都包含输入上下文中的相关摘录以及跟踪元数据,例如与查询相关的片段的出现频率。我们还通过拼接来自(nvidia/Nemotron-Personas-USA)的记录来构建长上下文样本,以达到所需的序列长度。问题设计旨在强调跨记录的多跳推理和信息聚合。上下文、问题和答案使用预定义的模板进行格式化,真实答案通过对底层记录执行 SQL 查询来获得。

金融推理。为了构建大规模金融推理训练语料库,我们采用基于模板的合成数据生成(SDG)流程,该流程将精选的种子集扩展为数十万个有依据的问答对。该流程从 SecQue 基准测试(benyoash2025secque)中获取了 565 个由专家撰写的种子问题,该数据集包含基于 SEC 10-K 和 10-Q 文件的金融分析问题。这些种子问题在标普 500 指数公司888https://en.wikipedia.org/wiki/List_of_S%26P_500_companies,访问于 2025 年。和财年(2019–2024)之间进行组合式扩展,其中比较性问题仅限于同一 GICS 子行业内的公司对,以保持语义连贯性。GPT-OSS-120B 对每个模板实例进行改写,每个组合最多生成三种不同的改写版本。生成的问题使用原始 SecQue 元数据映射到相关的 SEC 文件章节,对应的文档则转换为可配置 token 限制的 Markdown 格式。在答案生成方面,我们采用 GenSelect 策略(toshniwal2025genselectgenerativeapproachbestofn):使用 GPT-OSS-120B 以不同的随机种子为每个问题采样五个候选答案,然后由一个更大的评判模型(Qwen3-235B-A22B)根据数值准确性、金融方法论和逻辑合理性选择最佳回答。随后,一个较小的模型(Qwen3-30B-A3B)将每个问答对分类为“可回答”或“不可回答”,仅保留包含完整、实质性回答的问答对。在进行监督微调之前,合成数据生成(SDG)的输出会经过基于百分位数的异常值去除和去重处理。最终得到的数据集包含 366,243 个带有推理轨迹的金融问答对。

CUDA。我们利用基于 DeepSeek-R1 和 GPT-OSS-120B 的合成数据生成流水线,构建了一个大规模合成 CUDA 数据集,包含 10 万个用于内核生成、修复和优化的样本。种子问题来源于流行的开源库、NVIDIA 库 API 接口以及 BackendBench(saroufim2025backendbench)。这些种子被用于生成形如(PyTorch 参考实现,CUDA C++ 内核)和(自然语言规范,CUDA C++ 内核)的元组,每个元组都附带有推理过程。对于每个种子项,我们生成了多个候选内核,并在内部 CUDA 评估环境中对其正确性进行了严格验证。随后,根据性能对验证通过的内核进行排序,并保留性能最高的内核。此外,我们还收集了来自内部 CUDA 智能体的追踪数据,生成了形如(PyTorch 参考实现,有错误的 CUDA C++ 内核,错误信息,修正后的 CUDA C++ 内核)和(PyTorch 参考实现,运行缓慢的 CUDA C++ 内核,Nsight Compute 日志,优化后的 CUDA C++ 内核)的样本。利用公开可用的文档和官方代码示例,并遵循与 CUDA-C 数据相同的格式,我们生成了额外的 PyTorch 参考实现及对应的 CUDA 库实现(附有推理链),以及对齐的自然语言规范。这些库包括 Thrust、CUB、cuBLAS、cuDNN、cuSPARSE、cuRAND 和 cuSOLVER。

安全。与 Nemotron 3 Nano 相比,我们通过将强大的提示词库与两阶段合成响应生成策略相结合,显著增强了我们的安全框架。在保留来自 Nemotron Content Safety v2(ghosh-etal-2025-aegis2)、Gretel Safety Alignment v1(gretelai_gretel-safety-alignment-en-v1)、Harmful Tasks(hasan2024pruning)和 Red-Team-2K(luo2024jailbreakv_robustness)的核心提示词(涵盖内容安全和常见越狱技术)的基础上,我们新增了针对引发过度拒绝、人口统计偏见和版权复制的合成提示词。我们还扩展了越狱策略的覆盖范围,以更好地捕获新兴的对抗性技术,包括间接提示词注入攻击。

我们相较于 Nemotron 3 Nano 的主要改进在于引入了一套明确的响应策略框架。针对每条提示词,系统会综合提示词元数据、其标注的安全类别,以及一组轻量级辅助分类器(用于检测自残风险、人口统计特征定位或是否存在内嵌对抗性指令等属性)的预测结果,来推断出相应的响应策略。我们将这一决策过程视为一个多类别分类问题,其中每个类别对应一种符合安全准则的独特响应模式。这些响应模式规定了模型应如何行动:是提供支持性资源(如求助热线信息)、给出带有简要解释的拒绝回复,还是仅回应请求中的良性部分而忽略恶意内容。这确保了响应既安全、符合上下文语境,又能在一系列涉及安全敏感的场景中保持一致性。

遵循审慎对齐框架(guan2025deliberativealignmentreasoningenables),我们采用了一个两阶段生成流程,其中推理轨迹与最终响应分别进行策划,但均与我们的响应策略保持一致。在第一阶段,我们构建一条简洁的推理轨迹,引导模型反思提示词的安全属性,明确识别出该请求可能不安全或违反策略的原因,以及响应应受哪些约束。在第二阶段,我们基于这条推理轨迹生成最终响应,确保其遵循预设的响应策略和行为准则。这种结构化的分离方式鼓励模型对安全准则进行审慎思考,同时生成的响应具有一致性、符合策略要求且贴合上下文语境,从而确保最终响应遵循安全策略,同时尽量减少对该策略的不必要提及。最后,我们应用一个内容审核分类器来过滤任何被标记为不安全的响应,以此作为一道额外的保障措施,确保与安全目标的对齐。

搜索。为了提升搜索能力,我们使用 NeMo Data Designer(nemo-data-designer)生成了一套合成搜索智能体 SFT 数据集。该流程首先基于 Wikidata 知识图谱(vrandecic2014wikidata)构建种子提示词:我们通过 SPARQL(sparql2013)查询约 25 个经过验证的实体类别(城市、大学、电影、化学元素等)中连接度高的枢纽实体,随后在图中进行 4 到 8 跳的随机游走,并通过终止节点列表、反元关系排除以及最小路径长度阈值过滤掉退化路径。每条有效游走都会生成一个起始实体、一条事实关系链以及一个最终答案实体。

随后,Data Designer 分三个阶段处理这些种子数据:(1)草稿阶段,将结构化的知识图谱游走转换为自然语言的多跳问题;(2)混淆阶段,重写问题以隐藏中间实体并消除面包屑式的链式推理——生成搜索谜题式查询,要求求解者必须独立分解问题;(3)智能体阶段,由 MiniMax-M2(minimax2025m2)通过 Tavily(https://tavily.com)MCP 搜索工具发出网络搜索来解决混淆后的问题,生成带有支持性 URL 的、有据可查的搜索轨迹。每条生成的 SFT 记录都是一段多轮对话,其中助手轮次将链式推理与结构化工具调用交织在一起,而工具响应轮次则以 JSON 格式返回搜索结果,在每条轨迹平均 12 次工具调用中完整保留了“思考—行动—观察”循环。最后的结构化输出阶段将智能体的原始响应规范化为经过验证的 JSON 模式。

终端使用。用于增强终端能力的数据集遵循 Nemotron-Terminal(pi2026dataengineeringscalingllm)中描述的双流终端任务生成方法,共包含 84,848 个样本。该流程将现有高质量数据集的适配与基于全面终端技能分类法的合成任务生成相结合。数据来源分布为:68,924 个合成样本、8,125 个来自 Nemotron-Cascade-Math 的样本,以及 7,815 个来自 Nemotron-Cascade-Code(wang2025nemotroncascadescalingcascadedreinforcement)的样本。在轨迹构建方面,我们使用 DeepSeek-V3.2(deepseekai2024deepseekv32)作为主要引擎,通过智能体执行反馈循环,在隔离的 Docker 化环境中生成逐步解决方案轨迹。所有样本均使用 Terminus 2 智能体框架(merrill2026terminalbenchbenchmarkingagentshard)作为底层脚手架生成,该框架提供了一套统一的终端工具和结构化交互协议,以在长程轨迹中保持一致性和质量。

多语言。我们的多语言数据将英语 SFT 示例的合成翻译与句子级平行语料库相结合,以改进机器翻译。我们复用了 Nemotron 3 Nano 的逐行翻译流程,使用 Qwen2.5-Instruct-14b 翻译成六种语言(德语、西班牙语、法语、意大利语、日语和中文)。翻译后,我们应用过滤机制去除语言错误及其他常见失败模式的样本。我们观察到一种反复出现的模式:翻译破坏了提示词规范与答案格式之间的对齐——这种一致性通常在英语数据中得以保持。这种不匹配在初步测试中导致了指令遵循失败。为缓解此问题,我们引入了一个轻量级后编辑步骤,使用 Qwen3-4B-Thinking-2507 自动恢复格式合规性。我们还用额外的中英文语对扩展了平行语料库,并排除了此前会降低后训练性能的过短样本。

结构化查询语言(SQL)。为了提升 Nemotron 3 Super 在企业级 SQL 工作负载上的表现,我们使用 NeMo Data Designer(nemo-data-designer)生成了一个合成文本转 SQL 数据集。该数据集包含 96.5k 条记录,涵盖 MySQL、PostgreSQL 和 SQLite 三种数据库方言,横跨 60 个行业领域、700 个领域主题以及 90 个 SQL 概念类别(从基础 SELECT 语句到递归 CTE、窗口函数和地理空间查询)。每条样本都将一条自然语言提示词和一个完全合成的数据库模式上下文与目标 SQL 查询配对。为了提高鲁棒性并模拟生产数据库的真实混乱情况,该流程会在数据库上下文中注入干扰表和干扰列。具体来说,会将相关但不相关的表和列添加到数据库上下文中,迫使模型学会忽略无关的模式元素。提示词的多样性通过三个维度进行控制——指令风格(祈使句、陈述句、疑问句、上下文式、缩写式)、语言语域(正式、对话式、技术性、学术性、直接式)以及礼貌程度——从而生成自然且多样化的用户请求。最终包含 96.5k 条记录的数据集,是由 Data Designer 从一个更大的数据集中,通过针对每种方言的语法验证器和五个大语言模型作为评判者的评审机制进行验证和筛选后得到的。

对话式工具使用。许多模型已采用大规模专用工具使用训练数据来增强智能体能力(Liu2024ToolACE; deepseekai2024deepseekv32; kimiteam2025kimik2openagentic; 5team2025glm45agenticreasoningcoding)。对于 Nemotron 3 Super,我们通过一个完全合成的六阶段生成流程来扩展对话式工具使用数据:

  1. 1.

    领域生成:使用模型采样合成领域,通过迭代方式将初始生成结果扩展为专门的子领域。

  2. 2.

    策略与工具生成:生成客户服务策略及相关工具,通过自我优化进行迭代改进;使用少样本提示和语言模型作为评判者进行质量过滤,以保持风格和格式的一致性。

  3. 3.

    场景生成:为每个策略设置生成合理的用户画像、背景信息和咨询问题。

  4. 4.

    轨迹收集:针对每个策略-场景组合,模拟基于模型的智能体、用户与环境之间的客服交互过程。

  5. 5.

    验证:使用语言模型作为评判者,在结果层面和过程层面分别评估轨迹。

  6. 6.

    SFT 数据筛选:选取成功的轨迹用于 SFT,并通过剔除全部成功或全部失败的场景来过滤难度。

Refer to caption
图 14:用于 Nemotron 3 Super 的专用对话工具使用 SFT 数据的合成数据生成流水线概览。

该流水线的可视化展示如图 14 所示。我们在上述流水线的不同环节使用了 Qwen3-235B-A22B-Thinking-2507、Qwen3-32B、Qwen3-235B-A22B-Instruct-2507(yang2025qwen3technicalreport)、deepseek-r1-0528(deepseekai2025deepseekr1incentivizingreasoningcapability)、DeepSeek-V3.2(deepseekai2024deepseekv32)和 gpt-oss-120b(openai2025gptoss120bgptoss20bmodel),最终在 838 个领域生成了 279,116 条对话。这相比 Nemotron 3 Nano 实现了大幅规模扩展,后者仅使用了涵盖 5 个领域的 15,588 条对话。

通用工具使用。更广泛的通用工具调用合成数据流水线,首先从 ToolEyes (ToolEyes2025)、API-Bank (APIBank2023)、UltraTools (Huang2024UltraTool)、AutoTools (Shi2025AutoTools)、xLAM (Zhang2024xLAM)、Glaive-Function-Calling-v2 (GlaiveFunctionCallingV22025)、Toucan-1.5M (Xu2025Toucan) 以及作为下游合成任务生成基础的自定义编写工具中构建多样化的工具集。工具调用轨迹通过基于一个或多个此类工具集进行模拟生成。轨迹模拟涉及一个大语言模型扮演三个角色——用户(用户-LLM)、助手(助手-LLM)和工具环境(工具-LLM)。用户-LLM 的初始输入包括选定的工具集、从 Nemotron-Personas-USA (nvidia/Nemotron-Personas-USA) 中采样的人物画像,以及一个工具调用场景(单轮、多轮或多步骤)。用户-LLM 首先根据工具调用场景设计一个任务,该任务需与选定的人物画像相关,并能通过选定的工具集解决。助手-LLM 尝试通过生成工具调用并响应工具执行结果,在一轮或多轮中解决此任务。工具-LLM 负责根据助手-LLM 生成的工具调用和被调用的工具,生成模拟的工具执行结果。工具-LLM 会收到一个评分标准,该标准有助于识别工具调用中的语法和语义错误,同时还会收到原始用户查询,以便在工具调用成功时,工具结果能够结合上下文。为确保准确性,我们采用了类似专用工具调用数据生成中的轮次级和轨迹级评判器。轮次级评判器还与基于规则的验证相结合,以确保工具调用的正确性。我们使用 DeepSeek-v3.2 (DeepSeekV32025) 和 GLM-4.7 (GLM47Zai2025) 扩展此流水线,创建了一个包含 150 万条多样化工具调用轨迹的数据集。

图 15 展示了通用合成工具调用数据流水线的整体概览。

Refer to caption
图 15:Nemotron 3 Super 中使用的通用工具调用数据流水线概览。

3.1.2 SFT 数据混合

我们通用阶段1的SFT数据混合方案详见图16(未列出的所有数据集在混合方案中占比均低于1%)。我们总共在超过700万个样本上进行了训练。在阶段2中,我们使用了阶段1混合方案中85%的数据,并补充了256K和512K token的长上下文数据。与Nemotron 3 Nano相比,我们显著增加了智能体任务的体量和多样性,并在混合方案中为其分配了更大的比例。

Refer to caption
图16:Nemotron 3 Super的SFT数据混合方案。

3.1.3 推理控制

Nemotron 3 Super针对三种推理模式进行了训练:推理关闭模式、常规模式和低算力模式。低算力推理模式是一项新增功能。常规模式和低算力模式可选择与推理时预算控制(nvidia2025nemotronhfamilyaccurateefficient)结合使用。这些控制组合提供了灵活性,覆盖了准确性与效率权衡的整个范围,以满足客户在各种应用场景中的需求。

低算力推理模式是在SFT阶段引入的,方法是在该阶段添加由GPT-OSS-120B在其低算力模式下生成的训练样本(du2025nemotron)。这些低算力训练样本涵盖了数学推理、STEM问答和指令遵循等任务,按样本数量计算,占整体SFT数据的2%。低算力模式随后在RL阶段进行优化,这将在下一节讨论。

推理关闭模式和推理时预算控制的SFT方案与nvidia2025nemotron3nanoopen类似,但存在一些差异。我们从随机抽取的3%样本中剥离了推理轨迹,用于推理关闭模式。在主要SFT阶段之后,我们增加了一个简短的半在线SFT阶段(350步),用于推理时预算控制,在此阶段我们从模型中收集采样输出,并将12%的推理轨迹截断至随机的推理预算。

3.2 强化学习

Nemotron 3 Super后训练的RL阶段包括三个阶段,随后是一个MTP修复阶段,如图12所示:

  • — 第一阶段:基于可验证奖励的多环境强化学习(§3.2.1)。这是主要的训练阶段,我们在所有环境的完整集合上联合优化 Nemotron 3 Super。在统一的混合环境中进行训练,可以使每次强化学习更新都能获知完整的环境分布,并有助于防止在训练过程中个别任务出现性能倒退。

  • — 第二阶段:面向端到端软件工程任务的 SWE-RL(§3.2.2)。我们将 SWE-RL 作为一个独立阶段运行,因为 SWE 的 rollout 生成速度要慢得多,并且通常需要更长的上下文长度,当与较短周期的环境共同训练时,会造成吞吐量瓶颈。将这一阶段分离出来,使我们能够针对长周期、长上下文的轨迹调整 rollout 和批处理设置。

  • — 第三阶段:RLHF(§3.2.3)。最后,我们将 RLHF 作为一个独立的阶段来应用,以改善指令遵循行为、鲁棒性和整体交互质量。

  • — 第四阶段:MTP 修复。在此阶段,我们训练 MTP 头部,并保持其余权重冻结。我们复用来自 RLVR 的提示词,并使用类似于对生成响应进行 SFT 的负对数似然损失来训练 MTP 头部。我们发现这一阶段显著提高了 MTP 的准确性。

下面我们将描述这些阶段,包括训练算法、数据和系统设置。

3.2.1 第一阶段:基于可验证奖励的多环境强化学习

我们采用了类似于 Nemotron 3 Nano 的统一 RLVR 策略,但显著扩展了环境的数量。我们发现,同时在所有环境上进行训练能够带来稳定的收益,而单一环境训练则会导致在其他基准测试上出现严重的性能倒退。

我们的 RLVR 设置包含 21 个环境,涵盖多个领域,包括数学、代码、STEM、安全、聊天、指令遵循、长上下文能力、谜题以及各种智能体任务。在数据混合和课程学习方面,我们采用了类似于 Nemotron 3 Nano 的方法:我们过滤掉 SFT 模型能够持续提供正确答案的提示词,然后通过基于难度的课程学习对剩余样本进行排序。该方法的更多细节可在 Nemotron 3 Nano 中找到。

低开销推理

在多环境强化学习阶段,我们将一部分提示词转换为低能耗模式。对于每个低能耗提示词,其展开的奖励会根据正确性和生成的 token 数量进行调整。低能耗提示词的混合比例最初包含数学、STEM 问答和竞赛编程提示词的子集,总计占所有 RL 提示词的 2%,随后缩减为仅包含数学和 STEM 问答的子集,占 RL 提示词的 1%。对于数学和 STEM 问答,我们随机抽取子集。对于竞赛编程,我们有一组从 SFT 数据中保留的编程问题,并且仅从该保留集中采样用于低能耗编程提示词。实验结果表明,这种数据策略提供了足够的泛化能力,并且低能耗模式在多环境 RL 过程中在一系列基准测试上得到了改进。

RLVR 数据

与 Nemotron 3 Nano 相比,我们显著扩展了 RL 数据规模。下面描述我们在多环境 RL 中使用的 RL 数据集。大多数 RL 训练环境已在 Nemo Gym(nemo-gym)中开源。总体而言,我们在 21 个环境和 37 个不同的 RL 数据集上进行了训练。

  • — 数学。我们使用与 Nemotron 3 Nano 相同的竞赛数学题。对于该数据集,我们分别在启用和不启用 Python 执行工具的情况下进行训练。我们还引入了一个用于形式化证明验证的新环境。

  • — 代码。我们使用来自 Nemotron 3 Nano 和 wang2025nemotroncascadescalingcascadedreinforcement 的竞赛风格代码数据进行训练。我们还针对软件工程任务的单步补丁生成进行训练,为下一阶段的端到端 RL 做准备。

  • — STEM。我们纳入了 Nemotron 3 Nano 中的 STEM 数据集,并新增了经过精心策划、更具挑战性的科学问题。

  • — 指令遵循。我们用一个新的多挑战数据集扩充了 Nemotron 3 Nano 中的指令遵循数据。在此设置中,智能体必须遵循复杂的用户指令,其奖励根据预定义的评分标准计算。

  • — 安全性。我们新增了两个环境:一个旨在减少对安全相关提示词的过度拒答,另一个则用于提升对越狱攻击的鲁棒性。针对越狱攻击,种子提示词来自我们的 SFT 数据;为了在强化学习过程中暴露更难的攻击,我们遵循 PAIR(chao2024jailbreakingblackboxlarge)方法应用了一个迭代攻击流程,攻击一个早期的仅 SFT 检查点,并收集具有高攻击成功率的修改后提示词。

  • — 长上下文。我们使用了与 Nemotron 3 Nano 中引入的相同的长上下文环境。

  • — 智能体工具使用。除了 Nemotron 3 Nano 中的工具使用环境外,我们还新增了专注于对话式工具使用和终端使用的环境。

  • — 推理健身房。我们使用推理健身房(stojanovski2025reasoning)进行训练,从而能够在多样化的推理任务套件上进行学习。

3.2.2 第二阶段:面向软件工程的端到端强化学习

在 SWE-RL 阶段,我们提升了模型在多种测试框架下自主解决 GitHub 问题的能力。每次展开都会启动一个包含目标仓库的 Apptainer 容器,运行一个 OpenHands 智能体循环来生成代码补丁,并根据真实测试用例对其进行评估以获得二元奖励。为了实现工具多样性,我们在 OpenHands 中实现了 OpenCode 和 Codex 智能体类,它们匹配了 Claude Code 和 Codex CLI 的工具格式,在训练时复用同一个测试框架,同时改变工具和提示词。这种多框架训练提升了模型在推理时对所有目标框架的泛化能力和性能。

3.2.3 第三阶段:基于人类反馈的强化学习

我们遵循与 Nemotron 3 Nano 类似的方法进行 RLHF,训练一个大型 GenRM 模型以在强化学习期间提供监督。我们没有使用普通的 GenRM,而是按照 wang2025rlbff 中的方法训练了一个遵循原则的 GenRM。这些原则使我们能够引导 Nemotron 3 Super 在身份和安全相关等重要领域的行为。与 Nemotron 3 Nano 类似,我们使用 Qwen3-235B-A22B-Thinking-2507 作为训练 GenRM 的初始化模型。

为了训练 GenRM,我们使用了 Helpsteer 3 数据集(Wang2025HelpSteer3Preference)、lmarena-140k 数据集(chiang2024chatbot)中商业友好的子集,以及一些近期收集的人类偏好数据。与 Nemotron 3 Nano 不同,我们在多环境 RL 阶段全程使用 GenRM 进行训练,并在后训练的最后阶段单独执行了一个仅 RLHF 的阶段。

3.2.4 算法

我们采用异步 GRPO 设置,其中训练和推理在独立的 GPU 设备上解耦执行。推理工作节点持续生成轨迹,这些轨迹被存储在一个 rollout 缓冲区中。一旦收集到足够形成一批次的轨迹,该批次就会被发送到训练引擎进行模型更新。一旦新模型版本可用,我们就会将更新后的权重推送到推理工作节点。由于权重更新可能发生在 rollout 过程中,因此单条轨迹可能包含由不同模型版本生成的 token。在更新推理工作节点上的模型权重后,我们不会重新计算 KV 缓存。为了避免因策略滞后过大而导致精度下降,我们将推理工作节点限制为最多落后最新模型版本一个版本。

为了稳定训练并最小化由训练-推理不匹配和策略滞后引起的离策略效应,我们对基于训练和推理 logprobs 计算的重要性采样比率进行了掩码处理(Shao2024DeepSeekMath; team2025every; yao2025offpolicy)。

在多环境 RLVR 中,我们每步采样 256 个提示词,并为每个提示词生成 16 个回复。我们使用 4096 的批次大小进行训练,这对应于每次 rollout 进行一次梯度更新。我们以最大生成长度 49K token 开始训练,随后将其增加到 64K。

智能体强化学习——PivotRL:长周期智能体能力的后训练在效率与准确性之间存在矛盾。所谓长周期,指的是需要与环境进行多轮交互的任务,例如对话式工具使用、代码编辑、终端交互以及网络搜索。对于这类任务,SFT 成本低廉且操作简单,但往往会在目标领域之外(OOD)导致性能下降。端到端 RL 在很大程度上避免了这一结果,但其成本高昂,因为每次更新都需要在复杂环境中进行在线交互式 rollout。为解决这一问题,我们在 Super 的后训练中采用了 PivotRL(yi2026pivotrl)。

PivotRL 是一种基于助手轮次级别的 RL 方法,通过在 RL 过程中复用离线的 SFT 专家轨迹来解决上述权衡问题。它将训练聚焦于这些 SFT 轨迹中具有信息量的轮次(称为“关键点”),在这些轮次中,策略对下一步动作存在不确定性,并使用领域适配的奖励来将策略的动作与专家动作进行匹配,从而使模型因执行相似动作(而非完全一致的专家动作)而获得奖励。我们注意到,该方法大幅提升了智能体 RL 的效率,同时避免了 SFT 所面临的 OOD 性能退化问题。

我们将 PivotRL 应用于所有智能体领域,包括:智能体编程、搜索、终端使用以及对话式工具使用。我们很快将发布一篇包含更多细节的论文。

3.2.5 基础设施

当前前沿模型后训练的 RL 主要特征在于,将其规模扩展至日益多样化的任务或环境,这些任务或环境旨在让模型学习越来越通用的能力。将 RL 扩展到众多环境需要一个高性能、可扩展且标准化的接口,用于协调 rollout 与训练。为使用一个标准框架解决扩展性能与可扩展性方面的挑战,我们采用了 NeMo Gym(nemo-gym)和 NeMo RL(nemo-rl),以实现在多种不同环境/验证器上进行大规模 RL。

NeMo Gym 基于服务器的抽象概念构建。Gym 中有三种核心服务器类型:(1)智能体,(2)模型,以及(3)资源。智能体服务器实现强化学习环境的交互生成内核。模型服务器封装诸如 vLLM 之类的推理引擎,以提供提示词-响应 API,并仔细保留强化学习所需的模型 token 和推理对数概率数据及元数据。资源服务器提供用于根据给定交互生成结果计算奖励的验证 API。

我们的 Nemotron Super 3 RLVR 实验均基于 NeMo RL 和 NeMo Gym 的集成基础设施:NeMo RL 充当强化学习训练循环控制器,使用 Megatron-Core 进行大规模模型训练,并通过 NeMo Gym 和 vLLM 路由所有交互生成。

NeMo RL 和 NeMo Gym 使用 Ray 进行编排和资源管理,并在 SLURM 上部署 Ray 集群。Megatron 训练工作节点、vLLM 生成工作节点、Gym 环境和评判模型均被调度到单个 Ray 集群上。

异步强化学习基础设施:所有强化学习阶段均采用异步强化学习,其中生成过程可独立于训练过程进行,通过权衡交互生成结果与当前策略的贴合度来提升训练效率。训练采用一步离策略,每个训练步骤都预留给未来的训练步骤,因此不会浪费任何交互生成结果。训练和生成不在同一位置部署,这简化了部署流程,并避免了在异步训练和生成工作节点之间协调复杂的内存管理。

所有异步强化学习运行还使用了飞行中权重更新,即训练可以在不等待剩余正在进行的交互生成完成的情况下更新生成工作节点的权重。其结果是,单次交互生成可能包含来自不同时期策略的模型 token 和对数概率。启用飞行中权重更新对于加速异步强化学习训练至关重要。我们在飞行中权重更新后未重新计算 KV 缓存。

弹性:当我们扩展到 1000 块 GPU 时,遇到了若干问题,导致间歇性故障,这些问题在较小的作业规模中并未出现。这些问题分为两类:(1) 硬件相关 和 (2) 软件相关。

我们观察到若干硬件问题需要完全重启作业,因此也进行了多项优化以缩短启动时间,具体措施包括:(1) 将所有初始化过程并行化 (2) 预取所有虚拟环境和二进制文件 (3) 利用上游仓库(如 vLLM 和 flashinfer)中的缓存机制。

并行初始化加剧了后训练软件栈中端口绑定的潜在竞态条件,这成为了一个显著的故障点。后训练软件的多个组件都需要端口:(1) Ray 控制平面 (2) vLLM 工作节点和 OpenAI 服务器 (3) TCP 会合点 (4) NeMo Gym 服务器。由于单个节点上需要端口的进程数量众多,我们在 1000 块 GPU 规模下频繁遇到端口冲突,这些都属于检查时间到使用时间(TOCTOU)的竞态条件。我们观察到的模式是:一个组件会检查某个端口是否可用,但并未独占声明该端口,等到它(或它通知的其他进程)尝试绑定时,另一个进程已经占用了该端口。

SWE-RL 基础设施:在软件工程任务上训练模型需要一个 gym 环境,该环境能够执行数百个并发的智能体-代码库交互,每个交互都在独立的沙箱中运行,并返回基于真实测试执行得出的奖励信号。在 Nemo-Gym 的 SWE-RL 环境中,每次 rollout 都会启动一个包含目标仓库的 Apptainer 容器,运行 OpenHands 智能体循环以生成代码补丁,并运行真实测试来计算二元奖励。Rollout 使用 Ray 通过 SPREAD 调度策略分布在各个节点上。下面我们描述该环境的关键组件。

  • •

    使用 Apptainer 进行容器执行。由于集群上缺少 root 权限,我们无法使用 Docker 进行容器隔离。因此,我们采用 Apptainer(原名 Singularity)在预构建的容器镜像(.sif 文件)中运行每个 SWE 任务实例,通过可写的 tmpfs 覆盖层提供文件系统隔离,同时共享宿主机内核。

  • •

    OpenHands 智能体循环。该智能体循环由 OpenHands 的修改版本执行,管理每次交互的完整生命周期:初始化运行时、呈现问题描述、运行智能体的步骤循环(直至可配置的轮次上限)、提取 git 补丁以及清理环境。智能体通过基于 tmux 的会话,利用 bash 命令和文件操作与仓库工作区进行交互。

  • •

    内存管理。由于 Apptainer 容器共享宿主机内存和进程(与 Docker 的 cgroup 隔离不同),失控的智能体进程可能导致 OOM 状况,影响整个节点。我们实现了一个内存看门狗守护进程,用于监控 tmux 进程树的聚合 RSS,并在超过可配置限制时主动杀死窗格内的进程,同时保持 tmux 服务器存活以实现优雅恢复。

  • •

    命令黑名单。Apptainer 共享内核的特性意味着,智能体执行 killall 或 pkill 命令可能会终止同一节点上的训练进程或 vLLM 服务器。一个基于正则表达式的命令黑名单会在危险命令执行前进行拦截和阻止,并返回包含更安全替代方案的信息性错误消息。

  • •

    工具集多样性。为了在训练过程中增加工具集的多样性,同时避免构建独立的工具集集成,我们在 OpenHands 中实现了 OpenCode 和 Codex 智能体类,它们分别匹配各自外部工具集(Claude Code 和 Codex CLI)的输入/输出格式。这两个智能体都接入 OpenHands 现有的运行时和对话记忆,继承了容器管理和观察处理功能。

  • •

    序列化。我们将 gym 与模型服务器之间 HTTP 载荷的序列化从 Python 标准 json 替换为 orjson,因为每条轨迹轮次都携带提示词 token ID、生成 token ID 和对数概率,导致载荷体积较大,而 orjson 基于 Rust 的实现能有效应对此类场景。

3.3 后训练模型评估

媒体内容 · 前往原文查看
基准测试 N-3-Super Qwen3.5-122B-A10B GPT-OSS-120B
通用知识
MMLU-Pro 83.73 86.70 81.00
推理
AIME25(无工具) 90.21 90.36 92.50
HMMT Feb25(无工具) 93.67 91.40 90.00
HMMT Feb25(带工具) 94.73 89.55 -
GPQA(无工具) 79.23 86.60 80.10
GPQA(带工具) 82.70 - 80.09
LiveCodeBench(v5 2024-07 至 2024-12) 81.19 78.93 88.00
SciCode(子任务) 42.05 42.00 39.00
HLE(无工具) 18.26 25.30 14.90
HLE(带工具) 22.82 - 19.0
智能体能力
Terminal Bench(困难子集) 25.78 26.80 24.00
Terminal Bench Core 2.0 31.00 37.50 18.70
SWE-Bench(OpenHands) 60.47 66.40 41.9
SWE-Bench(OpenCode) 59.20 67.40 -
SWE-Bench(Codex) 53.73 61.20 -
SWE-Bench 多语言(OpenHands) 45.78 - 30.80
TauBench V2
航空 56.25 66.0 49.2
零售 62.83 62.6 67.80
电信 64.36 95.00 66.00
平均 61.15 74.53 61.0
BrowseComp 带搜索 31.28 - 33.89
BIRD Bench 41.80 - 38.25
对话与指令遵循
IFBench(提示词) 72.56 73.77 68.32
Scale AI 多挑战 55.23 61.50 58.29
Arena-Hard-V2 73.88 75.15 90.26
长上下文
AA-LCR 58.31 66.90 51.00
RULER 256k 96.83 96.74 52.30
RULER 512k 95.22 95.95 46.70
RULER 1M 91.64 91.33 22.30
多语言
MMLU-ProX(各语言平均) 79.36 85.06 76.59
WMT24++(英译其他语言) 86.67 87.84 88.89
表 5:Nemotron 3 Super 评估套件。我们与 Qwen-3.5-122B-A10B 和 GPT-OSS-120B 进行了对比。

我们在与 Nemotron 3 Nano 相同的广泛基准测试套件和评估栈上评估了 Nemotron 3 Super(nvidia2025nemotron3nanoopen),涵盖通用知识、推理、智能体能力、指令遵循、长上下文和多语言能力。所有评估结果均通过 Nemo Evaluator SDK999https://github.com/NVIDIA-NeMo/Evaluator 收集,对于大多数基准测试,则使用了 Nemo Skills Harness101010https://github.com/NVIDIA-NeMo/Skills。为便于复现,用于评估的、基于 NVIDIA Nemo Evaluator SDK 打包的 Nemo Skills 开源容器可在此处找到111111https://catalog.ngc.nvidia.com/orgs/nvidia/teams/eval-factory/containers/nemo_skills。除 Nemo Skills 外,评估还使用了专门的开源打包容器,用于 Tau-2 Bench(默认提示词)、Terminal Bench Hard(48 个任务)、ScaleAI Multi Challenge 多轮指令遵循、Ruler。关于评估设置的更多详情,请参见 Nemo Evaluator SDK 配置文件夹121212https://github.com/NVIDIA-NeMo/Evaluator/tree/main/packages/nemo-evaluator-launcher/examples/nemotron/nemotron-3-super。以下基准测试尚未集成到我们的开源工具中,对于这些测试,我们使用了其官方开源实现,或者使用了我们计划在未来开源的内部框架:SWE Bench Verified(OpenHands)、SWE Bench Multilingual(OpenHands)、BrowseComp with Search(内部实现,使用 Serp API)、Terminal Bench Core 2.0(Harbor)。

推理能力。

我们报告了在 AIME 25、HMMT Feb 25、GPQA(rein2023gpqa)、LiveCodeBench v5(jain2024livecodebench)、SciCode(tian2024scicoderesearchcodingbenchmark)和 HLE(phan2025humanitysexam)上的结果。在所有基准测试中,Nemotron 3 Super 与 GPT-OSS-120B 具有竞争力,同时略逊于 Qwen-3.5-122B。

智能体能力。

我们报告了在 TerminalBench(困难子集和 v2 集)、SWE-Bench(OpenHands、OpenCode、Codex 以及多语言集)(jimenez2023swe)、TauBench V2(航空、零售、电信及其平均值)(barres2025tau)和 BrowseComp(wei2025browsecomp)上的结果。对于 BrowseComp,我们的测试框架在很大程度上借鉴了 GPT OSS 发布的浏览器工具(openai2025gptoss120bgptoss20bmodel),并且我们没有采用任何上下文管理策略进行评估。对于 SQL,我们在 BIRD 基准测试 li2023bird 的开发集(1534 个样本,SQLite,执行准确率)上进行评估。在所有智能体基准测试中,Nemotron 3 Super 的表现优于或与 GPT-OSS 120B 相当,并且在某些测试框架上与 Qwen 3.5 122B 不相上下。

聊天与指令遵循能力。

我们报告了在 IFBench、Multi-Challenge、Arena-Hard V2(li2024wildchat)上的结果。在所有基准测试中,Nemotron 3 Super 与基线模型表现相当。

长上下文能力。

我们报告了在 Ruler(hsieh2024ruler)上的结果,每个任务使用 100 个样本,以及 AALCR 的结果。

多语言能力。

我们在 MMLU-ProX(xuan2025mmlu)和 WMT24++ enxx(deutsch2025wmt24++)上衡量多语言能力。Nemotron 3 Super 在这两个基准测试上均达到或优于基线模型。

为了与 GPT-OSS-120B 和 Qwen-3.5-122B-A10B 进行比较,我们尽可能使用官方公布的数据;当官方数据不可用时,我们遵循 Nemotron 3 Nano 报告(nvidia2025nemotron3nanoopen)的流程,要么从信誉良好的公共聚合平台获取数值(前提是与官方协议一致),要么使用官方评估设置自行计算得分。

4 面向推理的量化

我们使用 Model-Optimizer131313https://github.com/NVIDIA/Model-Optimizer/ 应用训练后量化(PTQ),对权重和激活值进行量化,以生成两个高效的部署检查点:适用于 Hopper 的 FP8(W8A8)和适用于 Blackwell 的 NVFP4(W4A4)。

4.1 Nemotron 3 Super FP8 检查点

对于 FP8 后训练量化校准,我们使用了后训练 SFT 数据集中包含 256 个样本、上下文长度为 65536 的一个小子集。对于 FP8 量化,我们对 MoE GEMM(包括路由专家和共享专家)以及 Mamba 线性层进行了量化。我们还将 KV Cache 保持在 FP8 格式,而 Mamba 状态缓存则量化为 FP16 以提升速度。该检查点中不同算子的精度分配总结于表 6。

媒体内容 · 前往原文查看
表 6:FP8 检查点与 BF16 基线的精度设置对比。
配置 FP8 检查点 BF16 基线
嵌入层 BF16 BF16
注意力 GEMM(QKV 和输出投影) BF16 BF16
KV Cache + 注意力 BMM1 FP8 FP8
注意力 BMM2 BF16 BF16
MoE GEMM(稀疏专家和共享专家) FP8 BF16
MoE 潜在投影 GEMM BF16 BF16
路由器 FP32 FP32
Mamba GEMM FP8 BF16
Mamba SSM 缓存 FP16 FP32
Mamba 一维卷积 BF16 BF16
输出层 BF16 BF16

4.2 Nemotron 3 Super FP4 检查点

FP4 是一种比 FP8 更激进的量化格式,对于预填充密集型推理工作负载(例如编码智能体部署)尤其具有吸引力,因为在这类场景中,线性层和 MoE GEMM 是主要的性能瓶颈。NVFP4 在 Blackwell GPU 上获得原生加速,并且相比 MXFP4(nvfp4_mxfp4)等替代 FP4 格式能提供更好的精度。用于推理的 NVFP4(nvpfp4_ptq_default)使用有符号 E2M1 值,并沿最后一个维度对大小为 16 的一维块进行逐块缩放。这些逐块缩放因子进一步通过一个按张量静态校准的 FP32 缩放因子量化为 FP8 E4M3。

在基准 NVFP4 PTQ 方案(nvpfp4_ptq_default)中,每个逐块缩放因子由该块内的最大绝对值决定。我们评估了一系列替代 PTQ 方法。这些实验的结果可在附录 B.1 中找到。总体最佳结果是通过一种混合 FP4 方案获得的:权重逐块缩放因子通过最小化权重 MSE 来选择,而激活逐块缩放因子则继续使用基于最大值的缩放。这一选择既有效又实用。权重量化是离线校准的,因此可以执行昂贵的缩放因子搜索而不影响运行时性能。激活量化必须在运行时高效计算,这使得缩放因子搜索算法不切实际。基于最大值的激活缩放因子在运行时性能和量化精度之间提供了良好的权衡。

此外,我们选择性地将某些层从 FP4(W4A4)提升至 FP8(W8A8)或 BF16(W16A16),以进一步提高精度。我们使用了 Model-Optimizer AutoQuantize(https://github.com/NVIDIA/Model-Optimizer/tree/main/examples/llm_ptq),这是一种受神经架构搜索(NAS)启发的方法,用于推导最优混合精度分配。AutoQuantize 会估算每个操作的敏感度,对可用量化选择的性能成本进行建模,并通过一种背包式优化过程求解最优的逐层分配。其敏感度指标遵循受最优脑外科手术(OBS)启发的二阶泰勒近似,正如 LLM-MQ(llmmq)中所引入的那样。AutoQuantize 将 LLM-MQ 推广到超越仅权重量化的范畴。它支持算子级量化,包括 GEMM 的权重和激活联合量化,并考虑了诸如算子融合等推理部署约束。详细的 AutoQuantize 算法在 B.2 中给出。

总体而言,我们最终的 NVFP4 PTQ 方案结合了:

  • •

    经过校准的、最小化 MSE 的逐块权重缩放,

  • •

    动态的、基于最大值的逐块激活缩放,以及

  • •

    通过 Model-Optimizer AutoQuantize 对敏感层进行选择性提升。

这种组合解决了朴素 NVFP4 PTQ 的精度损失问题,同时保留了部署所需的运行时效率。最终 NVFP4 检查点中每个算子的精度分配结果总结于表 7。

媒体内容 · 前往原文查看
表 7:主干网络 NVFP4 检查点与 BF16 基线相比的精度设置。
配置 是否经过 AutoQuantize 搜索? NVFP4 检查点 BF16 基线
嵌入层 否 BF16 BF16
注意力 QKV 投影 GEMM 是 BF16 BF16
注意力输出投影 GEMM 是 FP8 / BF16 BF16
KV 缓存 + 注意力 BMM1 否 FP8 FP8
注意力 BMM2 否 BF16 BF16
稀疏专家(路由)GEMM 是 NVFP4 BF16
共享专家 GEMM 是 NVFP4 / FP8 / BF16 BF16
MoE 潜在投影 GEMM 是 FP8 / BF16 BF16
路由器 否 FP32 FP32
Mamba 投影 GEMM 是 FP8 / BF16 BF16
Mamba 一维卷积 否 BF16 BF16
Mamba SSM 缓存 否 FP16 FP32
输出层 否 BF16 BF16

对于所有经过搜索的主干网络 GEMM,AutoQuantize 从 { NVFP4, FP8, BF16 } 候选精度中,在有效精度预算为 4.75 比特的条件下,基于量化敏感度目标为每个算子选择了分配方案。在搜索后的模型中,稀疏专家 GEMM 全部被分配为 NVFP4,注意力和 Mamba 投影 GEMM 被分配为 FP8 或 BF16,而共享专家 GEMM 则混合使用了 NVFP4、FP8 和 BF16。

将 AutoQuantize 与改进后的 NVFP4 PTQ 方案相结合,生成了一个以 FP4 为主的模型,仅有一小部分层保留为 FP8 或 BF16 以保持精度。完整的混合精度 PTQ 流程在单个配备 8 张 GPU 的 B200 节点上,使用来自 Nemotron 3 Super SFT 数据集的 512 个样本(序列长度为 4096),在不到 2 小时内完成。最终模型相对于 BF16 基线实现了 99.8% 的中位精度,同时保持了接近 FP4 的性能。最终评估结果报告于表 8。

媒体内容 · 前往原文查看
基准测试 N-3-Super N-3-Super FP8 N-3-Super NVFP4
通用知识
MMLU-Pro 83.73 83.63 83.33
推理
HMMT Feb25(使用工具) 94.73 94.38 95.36
GPQA(无工具) 79.23 79.36 79.42
LiveCodeBench(v6 2024-082025-05) 78.69 78.44 78.44
LiveCodeBench(v5 2024-072024-12) 81.19 80.99 80.56
SciCode(子任务) 42.05 41.38 40.83
HLE(无工具) 18.26 17.42 17.42
智能体
Terminal Bench(困难子集) 25.78 26.04 24.48
SWE-Bench(OpenCode) 60.47 - 59.90
TauBench V2
航空 56.25 56.25 54.75
零售 62.83 63.05 63.38
电信 64.36 63.93 63.27
平均 61.15 61.07 60.46
聊天与指令遵循
IFBench (prompt) 72.58 72.32 73.30
Scale AI Multi-Challenge 55.23 54.35 52.8
Arena-Hard-V2 (Hard Prompt) 73.88 76.06 76.00
长上下文
AA-LCR 58.31 57.69 58.06
RULER 128k 97.04 97.17 96.89
RULER 256k 96.83 96.84 96.81
RULER 512k 95.22 95.15 95.21
RULER 1M 91.64 91.43 91.60
多语言
MMLU-ProX (语言平均) 79.35 79.21 79.37
表 8:Nemotron 3 Super 评估套件。我们将 FP8 和 NVFP4 优化模型与 BF16 模型进行了比较。

4.3 Mamba 状态量化

在内存受限的场景中,Mamba 状态缓存(SSM 缓存)的 DRAM 读取成为解码速度的主要瓶颈。SSM 缓存默认以 FP32 格式存储。一种方案是,在算术运算以 FP32 执行的同时,将 SSM 缓存以 FP16 格式存储。在这种情况下,缓存从内存中以 FP16 格式取出,转换为 FP32 进行循环更新,然后再转换回 FP16 进行存储。表 9 展示了在 Nemotron 3 Super 早期检查点上进行的实验。这些结果表明,当与 W8A8 量化结合使用时,直接将 SSM 缓存转换为 FP16 可能导致冗长度增加高达 40%。即使在权重和激活值保持 BF16 格式的情况下,将 SSM 缓存转换为 FP16 也会导致冗长度增加高达 37%。

媒体内容 · 前往原文查看
表 9:SSM 缓存方案对代码基准测试和冗长度的影响。
准确率 补全 Token 数 冗长度增加
权重与 livecodebench scicode livecodebench scicode livecodebench scicode
激活值 SSM 缓存 (pass@1 (pass@1 (pass@1 (pass@1 (pass@1 (pass@1
精度 方案 avg-of-8) avg-of-8) avg-of-8) avg-of-8) avg-of-8) avg-of-8)
W16A16 FP32 72.91 40.90 21769 3680 0.00% 0.00%
W16A16 FP16 73.24 42.01 29812 3760 36.95% 2.19%
W16A16 FP16+SR (Philox 5) 72.00 41.94 21392 3580 1.73% 2.72%
W8A8 FP16 73.13 40.98 30536 3780 40.27% 2.70%
W8A8 INT16+block128 72.22 41.46 22406 3521 2.90% 4.30%
W8A8 FP16+SR (Philox 10) 72.22 40.38 22120 3672 1.71% 0.74%
W8A8 FP16+SR (Philox 5) 72.63 41.86 22159 3720 1.79% 1.08%
W8A8 FP16+SR (Philox 4) 72.85 40.46 21631 3785 0.63% 2.84%
W8A8 FP16+SR (Philox 3) 70.07 39.94 24098 3827 10.70% 3.98%

量化 Mamba 缓存的一个关键挑战在于,量化误差并不会局限于单个步骤。由于 Mamba 解码是循环式的,先前步骤的量化误差会传播到未来步骤,并随时间累积。通过展开循环更新过程,可以观察到这种量化误差的累积。设循环状态更新为 ,且第 步的缓存量化引入了加性误差 ,使得 。展开此递归过程可得

(3)

这表明,早期步骤的量化误差会通过后续的循环转换传播,并在解码过程中不断累积。

通过改变训练方式(例如 QAT 或 QAD)来解决这些量化误差并非易事。Mamba 训练使用的是分块状态空间对偶算法,该算法不会显式地体现递归关系以及推理时的缓存。在训练过程中精确建模循环解码时的缓存行为会带来巨大的开销。因此,我们专注于无需训练的方法,以恢复因缓存量化而损失的精度。

在 PTQ 过程中减少量化误差累积的一种方法是提高尾数精度。我们尝试了使用 INT16 而非 FP16 来存储 SSM 缓存。但简单的 INT16 量化并未改善冗长问题,因为张量级分析显示 SSM 缓存的动态范围很宽。随后,我们沿状态维度引入了大小为 128 的块上的 FP32 逐块缩放,以增加有效动态范围。这消除了冗长问题(表 9)。

我们还探索了一个假设,即误差累积与从 FP32 转换为 FP16 时的舍入有关。关键问题在于,向最近偶数舍入(RTNE)会在量化过程中引入偏差。由于 RTNE 将给定的输入映射到相同的舍入值,其量化误差相对于原始值而言方差为零,但偏差非零。相比之下,随机舍入(SR)在期望上是无偏的。在循环场景中,RTNE 的偏差会随时间一致地累积,而随机舍入则用零均值噪声取代了这种系统性漂移。基于这一观察,我们在将缓存转换为 FP16 之前应用了随机舍入,这修复了 BF16 基线和 FP8 检查点(表 9)的冗长问题。

表 9 展示了不同 SSM 缓存方案在 livecodebench 和 scicode 上的准确率和冗长度。采用逐块缩放因子的 INT16 和采用随机舍入的 FP16 均能保持与 FP32 基线相似的准确率和冗长度。我们选择使用 Philox<5> 伪随机数生成的 FP16 随机舍入(SR)作为 Nemotron 3 Super 的 SSM 缓存方案,原因有三:

  • •

    它不需要计算、存储和加载块缩放因子。

  • •

    Blackwell 提供了专门的 PTX 指令,用于在类型转换期间进行随机舍入。

  • •

    Blackwell 通过 cuRAND 支持基于 Philox 的伪随机数生成。

为了进一步提高效率,表 9 还改变了 Philox 的轮数。增加轮数可以提高生成值的统计质量,而减少轮数则可以降低伪随机数生成的开销。选择 Philox<5> 是为了在保持准确率和冗长度的同时,最小化伪随机数生成的开销。

5 结论

我们推出 Nemotron 3 Super,这是一个拥有 120B 总参数、12B 活跃参数的 MoE 混合 Mamba-Attention 架构模型,具备强大的智能体能力。Nemotron 3 Super 采用 LatentMoE 提升准确率,并引入 MTP 层通过推测解码加速推理。我们使用低精度 NVFP4 在 25 万亿文本 token 上对 Nemotron 3 Super 进行了预训练,随后在多样化的 RL 环境集合上进行了后训练。最后,我们将模型量化至 FP8 和 NVFP4,在不牺牲模型准确率的前提下实现了显著更高的推理吞吐量。Nemotron 3 Super 在广泛任务上达到比 GPT-OSS-120B 最高 2.2 倍的吞吐量,同时保持更高的准确率。我们在 HuggingFace 上发布了 Nemotron 3 Super 的预训练、后训练和量化检查点。

贡献者

我们感谢以下人员对 NVIDIA Nemotron 3 Super 做出的宝贵贡献。

Aakshita Chandiramani、Aaron Blakeman、Abdullahi Olaoye、Abhibha Gupta、Abhilash Somasamudramath、Abhinav Khattar、Adeola Adesoba、Adi Renduchintala、Adil Asif、Aditya Agrawal、Aditya Vavre、Ahmad Kiswani、Aishwarya Padmakumar、Ajay Hotchandani、Akanksha Shukla、Akhiad Bercovich、Aleksander Ficek、Aleksandr Shaposhnikov、Alex Gronskiy、Alex Kondratenko、Alex Neefus、Alex Steiner、Alex Yang、Alexander Bukharin、Alexander Young、Ali Hatamizadeh、Ali Taghibakhshi、Alina Galiautdinova、Alisa Liu、Alok Kumar、Ameya Sunil Mahabaleshwarkar、Amir Klein、Amit Zuker、Amnon Geifman、Anahita Bhiwandiwalla、Ananth Subramaniam、Andrew Tao、Anjaney Shrivastava、Anjulie Agrusa、Ankur Srivastava、Ankur Verma、Ann Guan、Anna Shors、Annamalai Chockalingam、Anubhav Mandarwal、Aparnaa Ramani、Arham Mehta、Arti Jain、Arun Venkatesan、Asha Anoosheh、Ashwath Aithal、Ashwin Poojary、Asif Ahamed、Asit Mishra、Asli Sabanci Demiroz、Asma Kuriparambil Thekkumpate、Atefeh Sohrabizadeh、Avinash Kaur、Ayush Dattagupta、Barath Subramaniam Anandan、Bardiya Sadeghi、Barnaby Simkin、Ben Lanir、Benedikt Schifferer、Benjamin Chislett、Besmira Nushi、Bilal Kartal、Bill Thiede、Bita Darvish Rouhani、Bobby Chen、Boris Ginsburg、Brandon Norick、Branislav Kisacanin、Brian Yu、Bryan Catanzaro、Buvaneswari Mani、Carlo del Mundo、Chankyu Lee、Chanran Kim、Chantal Hwang、Chao Ni、Charles Wang、Charlie Truong、Cheng-Ping Hsieh、Chenhan Yu、Chenjie Luo、Cherie Wang、Chetan Mungekar、Chintan Patel、Chris Alexiuk、Chris Holguin、Chris Wing、Christian Munley、Christopher Parisien、Chuck Desai、Chunyang Sheng、Collin Neale、Cyril Meurillon、Dakshi Kumar、Dan Gil、Dan Su、Dane Corneil、Daniel Afrimi、Daniel Burkhardt Eliuth Triana、Daniel Egert、Daniel Fatade Douglas O’Flaherty、Daniel Lo、Daniel Rohrer、Daniel Serebrenik、Daniil Sorokin、Daria Gitman、Daria Levy、Darko Stosic、David Edelsohn、David Messina、David Mosallanezhad、David Tamok、Deena Donia、Deepak Narayanan、Devin O’Kelly、Dheeraj Peri、Dhruv Nathawani、Di Wu、Dima Rekesh、Dina Yared、Divyanshu Kakwani、Dmitry Konyagin Brandon Tuttle、Dong Ahn、Dongfu Jiang、Dorrin Poorkay、Duncan Riach、Dusan Stosic、Dustin Van Stee、Edgar Minasyan、Edward Lin、Eileen Peters Long、Elad Segal、Elena Lantz、Elena Lewis、Ellie Evans、Elliott Ning、Eric Chung、Eric Harper、Eric Pham-Hung、Eric W. Tramel、Erick Galinkin、Erik Pounds、Esti Etrog、Evan Briones、Evan Wu、Evelina Bakhturina、Evgeny Tsykunov、Ewa Dobrowolska、Farshad Saberi Movahed、Farzan Memarian、Fay Wang、Fei Jia、Felipe Soares、Felipe Vieira Frujeri、Feng Chen、Fengguang Lin、Ferenc Galko、Fortuna Zhang、Frankie Siino、Frida Hou、Gantavya Bhatt、Gargi Prasad、Geethapriya Venkataramani、Geetika Gupta、George Armstrong、Gerald Shen、Giulio Borghesi、Gordana Neskovic、Gorkem Batmaz、Grace Lam、Grace Wu、Greg Pauloski、Greyson Davis、Grigor Nalbandyan、Guoming Zhang、Guy Farber、Guyue Huang、Haifeng Qian、Haran Kumar Shiv Kumar、Harry Kim、Harsh Sharma、Hayate Iso、Hayley Ross、Herbert Hum、Herman Sahota、Hexin Wang、Himanshu Soni、Hiren Upadhyay、Huy Nguyen、Iain Cunningham、Ido Galil、Ido Shahaf、Igino Padovani、Igor Gitman、Igor Shovkun、Ikroop Dhillon、Ilya Loshchilov、Ingrid Kelly、Itamar Schen、Itay Levy、Ivan Moshkov、Izik Golan、Izzy Putterman、Jain Tu、Jan Baczek、Jan Kautz、Jane Polak Scowcroft、Janica Rosenberg、Jared Casper、Jarrod Pflum、Jason Grant、Jason Sewall、Jatin Mitra、Jeffrey Glick、Jenny Chen、Jesse Oliver、Jiacheng Xu、Jiafan Zhu、Jialin Song、Jian Zhang、Jiaqi Zeng、Jie Lou、Jill Milton、Jim Chow、Jimmy Zhang、Jinhang Choi、Jining Huang、Jocelyn Huang、Joel Caruso、Joey Conway、Joey Guman、Johan Jatko、John Kamalu、Johnny Greco、Jonathan Cohen、Jonathan Raiman、Joseph Jennings、Joyjit Daw、Juan Yu、Julio Tapia、Junkeun Yi、Jupinder Parmar、Jyothi Achar、Kari Briski、Kartik Mattoo、Katherine Cheung、Katherine Luna、Keith Wyss、Kevin Shih、Kezhi Kong、Khanh Nguyen、Khushi Bhardwaj、Kirill Buryak、Kirthi Shankar Sivamani、Konstantinos Krommydas、Kris Murphy、Krishna C. Puvvada、Krzysztof Pawelec、Kumar Anik、Laikh Tewari、Laya Sleiman、Leo Du、Leon Derczynski、Li Ding、Lilach Ilan、Lingjie Wu、Lizzie Wei、Luis Vega、Lun Su、Maarten Van Segbroeck、Maer Rodrigues de Melo、Magaret Zhang、Mahan Fathi、Makesh Narsimhan Sreedhar、Makesh Sreedhar、Makesh Tarun Chandran、Manuel Reyes Gomez、Maor Ashkenazi、Marc Cuevas、Marc Romeijn、Margaret Zhang、Mark Cai、Mark Gabel、Markus Kliegl、Martyna Patelka、Maryam Moosaei、Matthew Varacalli、Matvei Novikov、Mauricio Ferrato、Mehrzad Samadi、Melissa Corpuz、Meng Xin、Mengdi Wang、Mengru Wang、Meredith Price、Micah Schaffer、Michael Andersch、Michael Boone、Michael Evans、Michael Z Wang、Miguel Martinez、Mikail Khona、Mike Chrzanowski、Mike Hollinger、Mingyuan Ma、Minseok Lee、Mohammad Dabbah、Mohammad Shoeybi、Mostofa Patwary、Nabin Mulepati、Nader Khalil、Najeeb Nabwani、Nancy Agarwal、Nanthini Balasubramaniam、Narimane Hennouni、Narsi Kodukula、Natalie Hereth、Nathaniel Pinckney、Nave Assaf、Negar Habibi、Nestor Qin、Neta Zmora、Netanel Haber、Nick Reamaroon、Nickson Quak、Nidhi Bhatia、Nikhil Jukar、Nikki Pope、Nikolai Ludwig、Nima Tajbakhsh、Nir Ailon、Nirmal Juluru、Nirmalya De、Nowel Pitt、Oleg Rybakov、Oleksii Hrinchuk、Oleksii Kuchaiev、Olivier Delalleau、Oluwatobi Olabiyi、Omer Ullman Argov、Omri Almog、Omri Puny、Oren Tropp、Otavio Padovani、Ouye Xie、Parth Chadha、Pasha Shamis、Paul Gibbons、Pavlo Molchanov、Peter Belcak、Peter Jin、Pinky Xu、Piotr Januszewski、Pooya Jannaty、Prachi Shevate、Pradeep Thalasta、Pranav Prashant Thombre、Prasoon Varshney、Prerana Gambhir、Pritam Gundecha、Przemek Tredak、Qing Miao、Qiyu Wan、Quan Tran Minh、Rabeeh Karimi Mahabadi、Rachel Oberman、Rachit Garg、Rahul Kandu、Raina Zhong、Ran El-Yaniv、Ran Zilberstein、Rasoul Shafipour、Renee Yao、Renjie Pi、Richard Mazzarese、Richard Wang、Rick Izzo、Ridhima Singla、Rima Shahbazyan、Rishabh Garg、Ritika Borkar、Ritu Gala、Riyad Islam、Robert Clark、Robert Hesse、Roger Waleffe、Rohit Varma Kalidindi、Rohit Watve、Roi Koren、Ron Fan、Ruchika Kharwar、Ruisi Cai、Ruoxi Zhang、Russell J. Hewett、Ryan Prenger、Ryan Timbrook、Ryota Egashira、Sadegh Mahdavi、Sagar Singh Ashutosh Joshi、Sahil Modi、Samuel Kriman、Sandeep Pombra、Sanjay Kariyappa、Sanjeev Satheesh、Santiago Pombo、Saori Kaji、Satish Pasumarthi、Saurav Mishra、Saurav Muralidharan、Scott Hara、Sean Narenthiran、Sebastian Rogawski、Seonjin Na、Seonmyeong Bak、Sepehr Sameni、Seth Poulos、Shahar Mor、Shantanu Acharya、Shaona Ghosh Adam Lord、Sharath Turuvekere Sreenivas、Shaun Kotek、Shaya Gharghabi、Shelby Thomas、Sheng-Chieh Lin、Shibani Likhite、Shiqing Fan、Shiyang Chen、Shreya Gopal、Shrimai Prabhumoye、Shubham Pachori、Shubham Toshniwal、Shuo Zhang、Shuoyang Ding、Shyam Renjith、Shyamala Prayaga、Siddhartha Jain、Simeng Sun、Sirisha Rella、Sirshak Das、Smita Ithape、Sneha Harishchandra S、Somshubra Majumdar、Soumye Singhal、Sri Harsha Singudasu、Sriharsha Niverty、Stas Sergienko、Stefana Gloginic、Stefania Alborghetti、Stephen Ge、Stephen McCullough、Sugam Dipak Devare、Suguna Varshini Velury、Sukrit Rao、Sumeet Kumar Barua、Sunny Gai、Suseella Panguluri、Sushil Koundinyan、Swathi Patnam、Sweta Priyadarshi、Swetha Bhendigeri、Syeda Nahida Akter、Sylendran Arunagiri、Tailling Yuan、Talor Abramovich、Tan Bui、Tan Yu、Terry Kong、Thanh Do、Thomas Gburek、Thorgane Marques、Tiffany Moore、Tijmen Blankevoort、Tim Moon、Timothy Ma、Tiyasa Mitra、Tomasz Grzegorzek、Tomer Asida、Tomer Bar Natan、Tomer Keren、Tomer Ronen、Traian Rebedea、Trenton Starkey、Tugrul Konuk、Twinkle Vashishth、Tyler Condensa、Udi Karpas、Ushnish De、Vahid Noorozi、Vahid Noroozi、Vanshil Atul Shah、Veena Vaidyanathan、Venkat Srinivasan、Venmugil Elango、Victor Cui、Vijay Korthikanti、Vikas Mehta、Virginia Adams、Virginia Wu、Vitaly Kurin、Vitaly Lavrukhin、Vladimir Anisimov、Wan Seo、Wanli Jiang、Wasi Uddin Ahmad、Wei Du、Wei Ping、Wei-Ming Chen、Wendy Quan、Wenliang Dai、Wenwen Gao、Will Jennings、William Zhang、Xiaowei Ren、Xiaowen Xin、Xin Li、Yang Yu、Yangyi Chen、Yaniv Galron、Yashaswi Karnati、Yejin Choi、Yev Meyer、Yi-Fu Wu、Yian Zhang、Ying Lin、Yonatan Geifman、Yonggan Fu、Yoshi Suhara、Youngeun Kwon、Yuan Zhang、Yuki Huang、Zach Moshe、Zhilin Wang、Zhiyu Cheng、Zhongbo Zhu、Zhuolin Yang、Zihan Liu、Zijia Chen、Zijie Yan、Zuhair Ahmed。

参考文献

附录 A 各基准测试合并评估

Refer to caption
图 17:在完整的 25T token 训练过程中,训练后的检查点与最佳离线检查点合并方案在各基准测试上的准确率对比。这 12 项基准测试涵盖通用知识(MMLU-Pro、MMLU)、代码生成(HumanEval、HumanEval+、MBPP、MBPP+)、数学推理(GSM8K、MATH-500)以及常识理解(RACE、ARC-Challenge、HellaSwag、WinoGrande)。阴影区域表示学习率衰减阶段。

附录 B FP4 训练后量化(PTQ)算法细节

B.1 PTQ 算法消融实验

本节展示了各种 PTQ 算法的评估准确率。在这些实验中,除最终分类层和注意力线性层之外的所有线性层均被量化为 NVFP4。

媒体内容 · 前往原文查看
表 10:PTQ 算法消融实验
算法 细节 MMLU-Pro GPQA LiveCodeBench AA-LCR
BF16 — 83.49 79.92 72.907 53.00
默认 NVFP4 PTQ(基线算法) 使用最大值校准计算静态逐张量缩放系数;逐块缩放系数则根据块最大值动态计算。 82.99 79.29 70.18 55.50
最小化 MSE 的权重逐块缩放系数 遍历权重逐块缩放系数以最小化逐块 MSE。 83.31 79.92 71.37 56.75
最小化输出 MSE 的权重逐块缩放系数 独立遍历权重逐块缩放系数以最小化 GEMM 输出 MSE。 83.05 78.98 71.00 57.06
GPTQ 使用 GPTQ(gptq)进行权重量化。 83.11 80.05 69.79 57.87

B.2 AutoQuantize 算法

每个操作的敏感度在其直接(或最近可用)输出处使用二阶度量进行测量:

其中 索引操作符, 表示操作符 在格式选择 下的量化操作符, 是所选测量点处的局部 Hessian 近似。测量点可以是任何将量化误差与 BF16 进行比较的位置;对于线性层,我们使用线性层的输出。

计算完整的 Hessian 矩阵代价高昂,因此我们使用对角 Hessian 近似,并通过对角 Fisher 信息矩阵进行经验估计。定义

其中 。由此得到的敏感度代理为

性能代价定义为:

然后 AutoQuantize 求解以下约束优化问题:

其中 `operator` 的选定格式,以及总部署成本预算。

B.2.1 部署约束感知搜索

1) 线性层融合。

推理运行时通常会融合线性算子,这要求融合组内采用统一的量化格式。该融合约束在每一层内部应用:仅该层的 Q、K、V 投影被融合,并需共享一种量化格式。对于融合后的 QKV 投影,我们将该组建模为一个决策变量,并将敏感度和成本聚合为:

该公式在我们的二阶敏感度近似下是有效的:当融合算子强制采用一种共享格式,但保留各分支的加性贡献时,融合输出的二次敏感度项在 Q、K、V 上仍保持加性。

2) MoE 层约束。

vLLM 和 TensorRT-LLM 的量化 MoE API 要求受约束 MoE 组内的所有稀疏专家共享一种量化格式。该共享格式约束同样在每一 MoE 层内部应用:仅同一层内的稀疏专家相互耦合。在 Nemotron 3 Super 中,每个稀疏专家包含 up_proj 和 down_proj,因此这些稀疏专家投影必须联合分配。我们将稀疏专家集建模为一个算子级决策:

其中 `MoE` 稀疏专家组(一个 MoE 层内所有耦合的稀疏专家 up_proj/down_proj 算子)。我们在 MoE 模块输出端测量敏感度,使该指标能够捕捉所有稀疏专家的联合贡献:

并将部署成本定义为所有稀疏专家的成本之和:

MoE 模块中的其他线性层,例如潜在投影层和共享专家,不在此稀疏专家耦合约束范围内,可以分配不同的量化格式。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org