跳到正文
北京时间
原文
Ollama:Blog·· 2026-08-11精选AI 评分68

NVIDIA Nemotron 3.5 Lightning 上架 Ollama,可完全本地运行

NVIDIA Nemotron 3.5 Lightning

AI 导读

NVIDIA Nemotron 3.5 Lightning 现已登陆 Ollama,可完全在本地设备上运行。该模型为 30B 总参数、每 token 仅 3B 激活的混合 MoE 开放模型,面向需要持续运行的智能体任务,支持最高 1M token 上下文,借助 MTP、DFlash 或 DSpark 推测解码获得最高 4x 吞吐提升,并可比同类开源模型快 30% 完成任务。

推荐理由

原文给出了参数结构、上下文长度、吞吐数据和本地运行入口,读者可以据此判断它是否适合长期运行的本地智能体工作流。

正文 · AI 翻译

2026年8月11日

NVIDIA Nemotron 3.5 Lightning 现已在 Ollama 上线,并且完全在你的本地设备上运行。这是 NVIDIA 推出的 300 亿参数(30 亿激活)开放模型,专为持续运行的智能体打造:收集上下文、调用工具,并完成多步骤任务。

Nemotron 3.5 Lightning 专为智能体任务而设计,例如读取文件、调用工具、整理结果,以及重试失败的操作。这些步骤大多不需要大型模型。每个 token 仅激活 30 亿参数,它面向本地系统而非数据中心打造,本地运行意味着你的数据始终留在你的设备上。

模型亮点

  • 在你工作的地方运行: 总参数 300 亿,每个 token 仅激活 30 亿,采用混合专家(MoE)架构。它可在 NVIDIA RTX PC、NVIDIA RTX PRO 工作站、NVIDIA DGX Spark 和 DGX Station 上本地运行,也可在数据中心和云端运行。
  • 为智能体框架而打造: 与 Nemotron Coalition 共同开发,并针对开发者已在使用的工具进行训练,涵盖编码、工具调用、指令遵循和多轮任务。
  • 100 万 token 上下文: 上下文长度最高可达 100 万,为多轮工作流中的长工具历史留出空间。
  • 优化推理: 使用多 token 预测(MTP)、DFlash 或 DSpark 进行投机解码,吞吐量比同类开放模型最高提升 4 倍。
  • 任你定制: 一个基于开放数据集训练的开放模型。针对特定任务进行后训练,并将结果部署到从边缘到数据中心的任何地方。

你可以构建什么

Nemotron 3.5 Lightning 在以下工作负载中表现出色:

  • 长期运行的个人助理。 邮件、日历、项目和预订。在本地运行时,智能体可以使用本地上下文,且这些内容不会被发送到其他地方。
  • 编码子智能体。 在你已使用的框架内运行测试、搜索代码库并应用重构。
  • 安全运营。 丰富告警、分类事件、查询日志、关联指标,并为分析师准备结构化发现。
  • 与云端并行的本地层级。 Nemotron 3.5 Lightning 在本地处理高吞吐量的步骤,而少数需要更大模型的步骤则由托管的大型模型接手。相同的 CLI,相同的 API。
  • 你自己训练的专家模型。 开放权重和开放数据集,因此你可以针对某一细分任务对 Nemotron 3.5 Lightning 进行后训练,并在本地运行结果。

开始使用

下载 Ollama,然后使用你选择的工具运行 Nemotron 3.5 Lightning。

通用聊天

ollama run nemotron-3.5-lightning

Claude Code

ollama launch claude --model nemotron-3.5-lightning

OpenClaw

ollama launch openclaw --model nemotron-3.5-lightning

Hermes Agent

ollama launch hermes --model nemotron-3.5-lightning

OpenCode

ollama launch opencode --model nemotron-3.5-lightning

对于使用 Apple 芯片的用户,Ollama 提供的该模型具备业界领先的性能:nemotron-3.5-lightning:30b-mlx。

在模型页面上查看更多集成。

同样的模式也适用于在 Ollama 云端运行的模型,因此智能体可以将单个步骤发送给更大的模型,而无需更改其他任何内容。

基准测试

与其他同规模的领先开源模型相比,Nemotron 3.5 Lightning 的吞吐量提升了 4 倍,任务完成时间缩短了 30%,并在智能体、编程和推理任务中提供领先的准确率。对于持续运行的智能体而言,吞吐量是最关键的指标:每分钟更多步骤意味着长任务能够完成。完整结果和测试配置见 NVIDIA 的发布博客。

来源:Ollama:Blog · ollama.com