跳到正文
北京时间
原文
LMSYS:Blog(Chatbot Arena 团队)· NVIDIA Nemotron Team and SGLang Team·· 2026-08-11精选AI 评分74

SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning

Blog SGLang Adds Day-0 Support for NVIDIA Nemotron 3.5 Lightning SGLang is excited to announce Day-0 support for NVIDIA Nemotron 3.5 Lightning, a customizable open model built to power always-on agents across local systems, the edge, the datacenter, and the cloud. ... NVIDIA Nemotron Team and SGLang Team

AI 导读

SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。

推荐理由

Nemotron 3.5 Lightning以3B活跃参数提供前沿agent能力,SGLang的即刻支持让开发者能用单命令启动高性能推理,将agent部署成本大幅压缩。

正文 · AI 翻译

SGLang 欣然宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,这是一款可定制的开放模型,旨在为本地系统、边缘、数据中心和云端的常驻智能体提供动力。

常驻智能体在多步骤工作流中收集上下文、进行推理、使用工具并自适应调整。前沿模型负责复杂的编排,而较小的模型则高效处理大批量的专业化任务。

Nemotron 3.5 Lightning 正是为处理这些大批量任务而打造。它从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并与 Nemotron Coalition 共同开发,将强大的编程、工具调用、指令遵循和多轮对话能力融合在一个 300 亿参数的混合专家模型中,每次仅激活 30 亿参数。

Nemotron 3.5 Lightning 可为本地个人助理提供动力,自动化金融与风险工作流,支持网络安全调查,优化电信运营,并改善零售体验。各组织可以针对其特定的术语、政策、工具和工作流对其进行后训练和部署。

借助 SGLang,开发者可以通过高性能、兼容 OpenAI 的推理栈来部署该模型,并将其连接到智能体框架、本地助理和专业化的企业工作流。

简而言之:NVIDIA Nemotron 3.5 Lightning

  • 架构:混合专家架构
  • 模型规模: 总参数量 30B,激活参数量 3B
  • 上下文长度: 最高 1 million tokens
  • 投机解码: 多 token 预测、DFlash 和 DSpark
  • 模态: 文本输入与文本输出
  • 训练: 从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并针对主流智能体框架进行了训练
  • 定制化: 使用开放数据集训练的开放模型,支持针对专门工作流进行后训练
  • 部署目标: NVIDIA DGX Spark、DGX Station、RTX PRO、RTX、NVIDIA Jetson、H100、H200、A100、L40S、B200/GB200 以及 B300/GB300
  • 发布时可用格式: BF16、NVFP4
  • Get started:

使用 SGLang 进行安装与快速开始

SGLang 提供高性能服务运行时、连续批处理、前缀缓存、投机解码以及兼容 OpenAI 的 API。以下基线命令使用 BF16 检查点:

docker run --rm -it \
  --gpus all \
  --cap-add SYS_NICE \
  --ipc=host \
  --network=host \
  --entrypoint /bin/bash \
  lmsysorg/sglang:dev-nemotron3-5-lightning
sglang serve \
    --model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
    --mamba-backend flashinfer \
    --mamba-radix-cache-strategy extra_buffer \
    --reasoning-parser nemotron_3 \
    --tool-call-parser qwen3_coder

服务器启动后,使用任意兼容 OpenAI 的客户端发送请求:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:30000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Briefly explain: what is SGLang?"},
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=1024,
)
choice = response.choices[0]
print("Reasoning:", choice.message.reasoning_content)
print("Content:", choice.message.content)

使用投机解码优化推理

Nemotron 3.5 Lightning 支持三种投机解码技术——多 Token 预测(MTP)、DFlash 和 DSpark——在保持目标模型输出质量的同时加速 Token 生成。

MTP 使用轻量级、模型集成的预测头来提议若干未来 Token;DFlash 使用基于扩散模型的草稿器并行生成整个候选块;DSpark 则增加了置信度感知的半自回归草稿生成,以在速度与 Token 接受质量之间取得平衡。三者结合,让团队能够针对其推理工作负载选择最佳的延迟、吞吐量和部署权衡方案。

对于低延迟服务,可在 H100、H200 和 DGX Spark 上使用 DSpark;若追求当前最大吞吐量,我们建议在不启用投机解码的情况下运行。

使用 MTP 运行 Nemotron 3.5 Lightning

Nemotron 3.5 Lightning 包含多 Token 预测。SGLang 通过其投机解码路径暴露 MTP,其中模型内置的预测头起草未来 Token,目标模型对其进行验证。

标准 SGLang MTP 接口使用 EAGLE 投机算法。具体每种硬件的命令参见 cookbook。

使用 DFlash 运行 Nemotron 3.5 Lightning

DFlash 使用一个专用的扩散草稿模型来提出一个线性的 token 块,由目标模型并行验证。在 SGLang 中,DFlash 需要兼容的草稿检查点,并且与 MTP 分开启用。

SGLang 的 DFlash 实现不支持数据并行注意力,并且要求流水线并行大小为 1。当前参数参考参见 SGLang 投机解码指南。

使用 DSpark 运行 Nemotron 3.5 Lightning

DSpark 是一种混合式推测器,结合了自回归与并行扩散式草稿生成,介于 MTP 的完全自回归方法与 DFlash 的完全基于扩散的方法之间,并在 DGX Spark 上取得了三者中的最佳性能。

为每个智能体步骤控制推理

Nemotron 3.5 Lightning 支持开启或关闭推理,允许路由器或智能体框架对困难步骤使用更深入的推理,对常规工作则直接给出答案。

推理默认启用。如需请求不带推理轨迹的直接回答,请传入enable_thinking: false通过chat_template_kwargs:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Classify this ticket: billing or technical?"}],
    extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)

对于启用推理的请求,可以省略 chat_template_kwargs(推理默认开启),也可以显式设置它:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Plan the steps to migrate this service."}],
    extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)

该模型还支持推理 token 预算。将 thinking_budget(通过 custom_params)与 enable_thinking 搭配使用,即可按请求调整推理深度和响应时间:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Debug why this build is failing."}],
    extra_body={
        "chat_template_kwargs": {"enable_thinking": True},
        "custom_params": {"thinking_budget": 512},
    },
)

推理控制在多模型系统中尤为实用:编排器可以为规划、编码和模糊决策分配更大的预算,而对提取、分类和结构化转换则使用关闭推理模式或较小的预算。

为 Nemotron 3.5 Lightning 优化推理

Nemotron 3.5 Lightning 在架构上与 Nemotron 3 完全相同,区别仅在于权重和投机解码栈,因此大部分性能优化工作都落在运行时本身。以下是我们向上游 SGLang 贡献的内容:

  • DSpark 集成。我们将 DSpark——一种融合自回归与扩散式起草的混合投机器——接入 SGLang 和 Nemotron 模型定义,让你在 MTP 和 DFlash 之外还有三种投机器可供选择。
  • 量化 DSpark 起草头。将起草头量化为 W4A16 可降低其内存占用和每步延迟,同时不影响接受率,这在 DGX Spark 等内存受限的部件上尤为重要。
  • 移除同步与异步调度。 我们消除了 draft-and-verify 循环中的主机-设备同步,并启用了异步调度,因此当当前批次仍在执行时,下一批次就已准备就绪。

Nemotron 3.5 Lightning 为专用 AI 带来领先的准确率与效率

Nemotron 3.5 Lightning 结合了混合 MoE 架构——其 30B 参数中每个 token 仅激活 3B——与多 token 预测,以减少计算并加速生成。这些优化带来比同等规模开源模型最高 4 倍的吞吐量,帮助智能体更快完成专用任务。

Nemotron 3.5 Lightning 从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并在主流智能体框架上训练,将前沿级智能体能力迁移到一个紧凑、高效的模型中。它在智能体生产力、编程、工具使用、指令遵循和长上下文推理等基准测试中表现出色。

如图 1 所示,更高的推理吞吐量和 token 效率使 Nemotron 3.5 Lightning 处于效率前沿,帮助常驻智能体更快完成高负载工作。

Line chart comparing PinchBench accuracy with time to complete 10,000 tasks. Nemotron 3.5 Lightning reaches similar accuracy as Qwen3.6-35B roughly 30% faster and sits well ahead of Gemma 4 26B.

图 1:Nemotron 3.5 Lightning 在相当准确率下完成智能体任务最高快 30%,从而领跑效率前沿。

总结

NVIDIA Nemotron 3.5 Lightning 将快速、可定制的智能体智能带到本地系统、边缘、数据中心和云端。借助 SGLang Day-0 支持,开发者可以通过高性能、兼容 OpenAI 的技术栈来部署该模型;按智能体步骤控制推理;为 DGX Spark 等本地部署管理内存;并通过多 token 预测、DFlash 或 DSpark 加速生成。

对于跨多个模型路由工作的系统,Nemotron 3.5 Lightning 为高并发的专业化任务提供了一个极具吸引力的选择,在这些任务中,准确性、速度、开放性和部署控制都至关重要。

  • 从 Hugging Face 下载模型权重:BF16 和 NVFP4
  • 使用 cookbook 通过 SGLang 运行 Nemotron 3.5 Lightning

及时了解最新动态,请NVIDIA Nemotron订阅 NVIDIA 新闻,并在以下平台关注 NVIDIA AI:LinkedIn, X, YouTube,以及Nemotron 频道在Discord.

致谢

感谢所有为将 NVIDIA Nemotron 3.5 Lightning 引入 SGLang 做出贡献的人。

NVIDIA:Nirmal Kumar Juluru、Anusha Pant、Amir Klein、Faradawn Yang、Nave Assaf、Ryan Stewart、Alex Steiner、Bita Rouhani、Seong Hee Lee

SGLang 团队

常见问题

与 Nemotron 3 Nano 相比有哪些新变化?

Nemotron 3 Nano 确立了高效的混合 Mamba-Transformer MoE 设计,总参数量 30B,激活参数量 3B,上下文窗口 1M token,并支持可控推理。Nemotron 3.5 Lightning 在此基础上从三个重要方面进行了构建:

  • 前沿模型知识蒸馏: Nemotron 3.5 Lightning 从 Nemotron 3 Ultra 蒸馏而来,将 NVIDIA 前沿智能体模型的能力迁移到小得多的部署规模中。
  • 智能体框架优化: Nemotron 3.5 Lightning 针对主流智能体框架和多轮工作流进行了训练,重点涵盖编程、工具使用、指令遵循和专项任务完成。
  • 投机解码: Nemotron 3.5 Lightning 支持多 token 预测(MTP)、DFlash 和 DSpark,通过并行起草和验证多个 token 来加速生成。

最终成果是一个旨在用更少时间更准确地完成更多智能体任务的模型。

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org