跳到正文
北京时间
原文
MarkTechPost(RSS)· Asif Razzaq·· 2026-08-10精选AI 评分75

NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

NVIDIA Releases NemotronLabs VoiceChat 11B: An Open Full-Duplex Speech-to-Speech Model with ~450 ms Turn-Taking and Live Tool Calling

AI 导读

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。

推荐理由

端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。

正文 · AI 翻译

NVIDIA 发布了 NemotronLabs VoiceChat 11B,这是一个开放的 11B 端到端语音到语音模型,用于实时全双工对话。它没有将 ASR、LLM 和 TTS 串联起来,而是在一个统一的网络中执行流式语音理解和语音生成。这消除了级联堆栈所需的多模型编排和 API 交接,并缩短了端到端延迟:在 Full-Duplex-Bench 1.0 上测得的流畅轮次切换延迟为 448 ms。该模型在说话的同时进行聆听,因此用户可以在轮次中途插话,而智能体会让出话轮,在 480 ms 时的接管率为 1.00。它还是首个支持在对话持续进行时调用工具的开源全双工模型,它使用单独的输出通道来处理 <TOOLCALL> 脚本,以及由操作员定义的“等待中”语句,用于在 API 运行期间填补空档。

它可以部署吗?

部分可以——如今可用于试点部署,但还不能用于生产环境。 权重和容器均已公开,许可证也很宽松。但 NVIDIA 团队表示,该检查点“仅可用于研究目的”,而且代码仓库记录了真实的失败模式:两分钟音频上下文上限、若干轮次后退化为无法恢复的乱码、一轮结束后失控的自言自语,以及用户转写中出现的丢词。

  • 适用公司:任何能够分配一块显存至少 80 GB 的 GPU 的团队——A100、H100、RTX 6000 Pro,或在 x86_64 Linux 上的 B200。这涵盖了 AI 原生初创公司、获得融资的成长期企业、企业研发与创新实验室、GPU 云服务提供商以及高校语音研究团队。目前没有托管 API,也没有推理服务商提供该模型,因此无法获得 GPU 的团队可能无法对其进行评估。
  • 行业:联络中心与客户体验平台、汽车座舱助手、零售与免下车点餐、电信 IVR 现代化改造、游戏与 NPC 对话,以及无障碍工具。
  • 应用:支持打断的语音智能体、基于内部 API 的语音前端、实时查询助手(天气、定价、订单状态),以及双工延迟基准测试框架。

架构

该模型是一种混合 Mamba/Transformer 架构,由三个现有的 NVIDIA 组件以及一条新的输出路径组合而成:

  • AFast Conformer 语音编码器来自Nemotron-Speech-Streaming-En-0.6b,它持续对输入的 16 kHz 流进行编码。
  • NVIDIA Nemotron Nano v2 LLM 主干,它接收音频 token 并预测文本 token。
  • 一个 NVIDIA TTS 解码器和编解码器,用于预测音频编码,并以 22.05 kHz 渲染为智能体语音。
  • 一个独立的输出通道,专用于工具调用脚本。

输出包括智能体音频、智能体文本以及持续运行的用户转写。训练使用了约 550k 小时的音频,涵盖真实和合成语料库,构建于 SALM-Duplex 和 Audio Flamingo 3 之上。

无冷场的工具调用

工具调用以 <TOOLCALL> 块的形式在侧通道上发出;你的代码在 <TOOL_RESPONSE> 块中返回结果。值得注意的部分是等待提示语:针对每个工具,操作员定义一句话,当模型生成触发调用的文本时,智能体立即说出这句话,这样在 API 运行期间对话就不会陷入沉默。

约束条件是明确的。NVIDIA 建议每个会话最多使用五个工具,模型无法可靠地同时调用多个工具,并且在工具执行期间用户无法打断智能体。系统提示词和工具响应必须仅使用 ASCII 字符且适合 TTS。

性能

在 Full-Duplex-Bench 1.0 上:流畅轮次转换 TOR 为 0.82,延迟 448 ms;用户打断 TOR 为 1.00,延迟 480 ms;停顿处理 TOR 为 0.153(合成数据)和 0.255(Candor),其中数值越低越好。

在 AU Harness BFCL-v3 语音工具调用上:简单任务 58.5%,多任务 62.5%,并行任务 42.5%,并行多任务 27.5%,无关性 89.6%,平均 56.1%。在 Full-Duplex-Bench v3 上:工具选择 82.5%,参数准确率 44.2%,pass@1 33%。

NVIDIA 报告称,该模型排名在开源全双工模型中位列第 2在VoiceBench上,并在 Full-Duplex-Bench 1.0 的开源模型中位列第 2。

交互式讲解

核心要点

  • 一个 11B 模型取代了 ASR → LLM → TTS 链路,实测轮次切换延迟为 448 ms。
  • 首个支持工具调用的开源全双工模型,使用侧通道以及由操作者定义的等待提示消息。
  • 权重采用 OpenMDW-1.1 宽松许可,但 NVIDIA 将该 checkpoint 标注为仅限研究用途。
  • 需要一块 80 GB GPU;目前不存在托管 API。

查看 Hugging Face 模型卡、GitHub(NeMo Speech) 以及 NGC 容器。另外,欢迎在 Twitter 上关注我们,别忘了加入我们拥有 15 万+ 成员的 ML SubReddit,并订阅 我们的新闻通讯。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上加入我们了。

来源:MarkTechPost(RSS) · marktechpost.com