NVIDIA Nemotron 3.5 Lightning 上架 Ollama,可完全本地运行
NVIDIA Nemotron 3.5 Lightning
NVIDIA Nemotron 3.5 Lightning 现已登陆 Ollama,可完全在本地设备上运行。该模型为 30B 总参数、每 token 仅 3B 激活的混合 MoE 开放模型,面向需要持续运行的智能体任务,支持最高 1M token 上下文,借助 MTP、DFlash 或 DSpark 推测解码获得最高 4x 吞吐提升,并可比同类开源模型快 30% 完成任务。
原文给出了参数结构、上下文长度、吞吐数据和本地运行入口,读者可以据此判断它是否适合长期运行的本地智能体工作流。
2026年8月11日
NVIDIA Nemotron 3.5 Lightning 现已在 Ollama 上线,并且完全在你的本地设备上运行。这是 NVIDIA 推出的 300 亿参数(30 亿激活)开放模型,专为持续运行的智能体打造:收集上下文、调用工具,并完成多步骤任务。
Nemotron 3.5 Lightning 专为智能体任务而设计,例如读取文件、调用工具、整理结果,以及重试失败的操作。这些步骤大多不需要大型模型。每个 token 仅激活 30 亿参数,它面向本地系统而非数据中心打造,本地运行意味着你的数据始终留在你的设备上。
模型亮点
- 在你工作的地方运行: 总参数 300 亿,每个 token 仅激活 30 亿,采用混合专家(MoE)架构。它可在 NVIDIA RTX PC、NVIDIA RTX PRO 工作站、NVIDIA DGX Spark 和 DGX Station 上本地运行,也可在数据中心和云端运行。
- 为智能体框架而打造: 与 Nemotron Coalition 共同开发,并针对开发者已在使用的工具进行训练,涵盖编码、工具调用、指令遵循和多轮任务。
- 100 万 token 上下文: 上下文长度最高可达 100 万,为多轮工作流中的长工具历史留出空间。
- 优化推理: 使用多 token 预测(MTP)、DFlash 或 DSpark 进行投机解码,吞吐量比同类开放模型最高提升 4 倍。
- 任你定制: 一个基于开放数据集训练的开放模型。针对特定任务进行后训练,并将结果部署到从边缘到数据中心的任何地方。
你可以构建什么
Nemotron 3.5 Lightning 在以下工作负载中表现出色:
- 长期运行的个人助理。 邮件、日历、项目和预订。在本地运行时,智能体可以使用本地上下文,且这些内容不会被发送到其他地方。
- 编码子智能体。 在你已使用的框架内运行测试、搜索代码库并应用重构。
- 安全运营。 丰富告警、分类事件、查询日志、关联指标,并为分析师准备结构化发现。
- 与云端并行的本地层级。 Nemotron 3.5 Lightning 在本地处理高吞吐量的步骤,而少数需要更大模型的步骤则由托管的大型模型接手。相同的 CLI,相同的 API。
- 你自己训练的专家模型。 开放权重和开放数据集,因此你可以针对某一细分任务对 Nemotron 3.5 Lightning 进行后训练,并在本地运行结果。
开始使用
下载 Ollama,然后使用你选择的工具运行 Nemotron 3.5 Lightning。
通用聊天
ollama run nemotron-3.5-lightning
Claude Code
ollama launch claude --model nemotron-3.5-lightning
OpenClaw
ollama launch openclaw --model nemotron-3.5-lightning
Hermes Agent
ollama launch hermes --model nemotron-3.5-lightning
OpenCode
ollama launch opencode --model nemotron-3.5-lightning
对于使用 Apple 芯片的用户,Ollama 提供的该模型具备业界领先的性能:nemotron-3.5-lightning:30b-mlx。
在模型页面上查看更多集成。
同样的模式也适用于在 Ollama 云端运行的模型,因此智能体可以将单个步骤发送给更大的模型,而无需更改其他任何内容。
基准测试
与其他同规模的领先开源模型相比,Nemotron 3.5 Lightning 的吞吐量提升了 4 倍,任务完成时间缩短了 30%,并在智能体、编程和推理任务中提供领先的准确率。对于持续运行的智能体而言,吞吐量是最关键的指标:每分钟更多步骤意味着长任务能够完成。完整结果和测试配置见 NVIDIA 的发布博客。
来源:Ollama:Blog · ollama.com