Inception Labs 发布 Mercury 2:首个在 NVIDIA GPU 上每秒解码超 1000 token 的推理扩散语言模型
Mercury 2: the first reasoning model fast enough to pick up the phone
Inception Labs 发布 Mercury 2,称其为全球首个推理扩散语言模型(dLLM),在 NVIDIA H100 上以 1000+ token/秒并行解码,300 token 的推理链可在约 300ms 内完成,适配语音对话延迟预算。
官方给出扩散架构推理模型在 NVIDIA GPU 上的延迟与定价数据,语音 Agent 开发者可以据此评估是否能替换现有默认模型。
过去两年,每个前沿实验室都以同样的方式提升智能水平:让模型思考更长时间。推理模型现在在开口之前会消耗数千个思考(高谈阔论、冥思苦想、磨磨蹭蹭)token。在主流的自回归解码范式下,这些 token 中的每一个都是顺序生成的,每个都需要一次完整的前向传播。在与语音代理通话时,这种生成(解码)时间不断累积,以至于你宁愿直接挂断。
结果是行业中出现了奇怪的分裂。推理智能前沿一路狂奔,而实时智能却停滞不前。语音是 GPT 5.x、Claude Sonnet 和 Gemini Pro 唯一无法达标的垂直领域之一,因为没人愿意在每次询问牙医预约问题时都等上 3 秒钟。
Mercury 2 是全球首个推理扩散语言模型,在标准 NVIDIA GPU 上每秒解码 1000+ token。这足够快,可以在自然对话的延迟预算内完成一次完整推理并开始说话。我们将推理成本从 3 秒的沉默缩短到仅 300 毫秒。

语音代理仍停留在 2025 年 4 月
语音客户告诉我们,端到端 LLM 延迟必须低于约 500 毫秒,否则对话就不再像人类。
一个推理模型以典型的自回归 60–100 token/秒的速度输出 500 个思维链 token,会超出该预算五到八秒。因此语音开发者不得不在听起来像坏掉的智能模型和无法遵循指令的快速模型之间做出选择。
大多数人以同样的方式解决了这个问题:GPT 4.1,OpenAI 最智能的非推理模型——来自 2025 年 4 月(!)——仍然是大多数生产语音代理的默认大脑。它是唯一几个将强大的指令遵循和工具调用与实时延迟相结合、且价格可扩展到每天数千次调用的模型之一。但 GPT 4.1 计划于今年晚些时候在许多提供商处停用,这意味着语音代理行业即将失去其默认模型,而没有一个前沿推理模型能接替它的位置。
一个逃生通道是异类硬件:在 Cerebras 或 Groq 上提供服务可以获得令人印象深刻的自回归解码速度。但定制芯片的容量稀缺,且经常被预订一空,等待时间长达 12 个月以上;Cerebras 与 OpenAI 达成的多年巨额协议锁定了其大部分资源,挤出了较小的合同。所以真正的问题是:如果你能在人人都有的 NVIDIA GPU 上获得定制芯片的解码速度,那会怎样?

为什么扩散不需要一次只生成一个 token
每个自回归 LLM 的瓶颈都是结构性的。顺序解码意味着每个输出 token 都需要一次完整的前向传播,而每次前向传播都意味着将整个模型的权重从 GPU HBM 流式传输到片上 SRAM。在延迟敏感型服务所需的低批量大小下,这使 GPU 的大部分算术带宽处于闲置状态。
Mercury 模型是扩散大语言模型(dLLM),使用一种并行生成 token 的架构。
正如我们在技术报告中详述的那样,生成通过一对过程来实现。一个前向过程接收干净的文本,并在一系列步骤中逐步将其破坏为噪声。模型——一个标准的 Transformer——被训练以反向运行这一过程:给定一个带噪的潜在序列,它预测出干净的文本,并通过去噪目标进行训练,使其能够同时处理序列中的所有位置。
每次去噪过程都会处理许多 token,因此生成的算术强度远高于一次一个 token 的解码,也就是说,从内存中加载的同一份权重完成了许多 token 的有用计算。其结果是,在 NVIDIA H100 上达到每秒超过 1,000 个 token——这一吞吐量此前只有在定制芯片上才能实现——同时质量可与 GPT Mini 和 Claude Haiku 等较小的前沿模型相媲美。
实时推理的数学计算
在每秒 1000+ token 的速度下,一段 300 token 的推理轨迹可在 300 毫秒内完成。这意味着让推理模型擅长工具选择、策略合规和多步骤工作流的深思熟虑,如今可以容纳在单次交互中,对呼叫者而言悄无声息。
Mercury 2 使用一个 reasoning_effort 旋钮,具有四种设置——instant、low、medium 和 high——因此构建者可以根据其应用所需的智能程度进行调节。
我们在 IFBench(指令遵循)和 Tau3Bench Telecom(面向客服代理的真实多轮工具调用)上对 instant、low 和 medium 进行了基准测试,延迟则基于 OpenCall 的真实生产提示进行测量。
“在 OpenCall,我们一直使用 Mercury 2 来驱动我们的生产语音代理,处理复杂的患者来电。在我们的测试中,Mercury 2 在指令遵循、工具使用以及多步骤工作流推理方面,表现优于运行在 Cerebras 上的 GPT OSS 120B。它为我们提供了所需的推理质量,同时没有牺牲自然电话通话体验所需的低延迟。”
Oliver Silverstein,OpenCall 首席执行官
Instant 以智能换取反射速度,适用于确认、附和以及不需要工具调用的轮次。Low 在指令遵循方面已经以极低的延迟击败了 GPT 4.1。而 medium 则是亮点所在,在 IFBench 上以 27 分的优势击败 GPT 4.1,在 Tau3Bench Telecom 上以 24 分的优势胜出,同时仍然比 GPT 4.1 的非推理解码更快:


为什么级联流水线仍然胜过语音到语音
你可能会想:既然语音到语音模型已经存在,为什么还要优化级联流水线中的 LLM 呢?尽管全双工语音模型很自然,但在 2026 年,几乎所有生产语音代理仍然运行 ASR → LLM → TTS,至少有以下四个原因:
灵活性。在多个地区和口音下运营语音代理时,你可以按市场更换转录模型和语音。
可观测性。级联流水线产生的是文本转录,而不是数千小时的不透明音频,从而支持可扩展的质量保证和审计。
智能。如今的语音到语音模型在长上下文性能、多轮连贯性和工具调用准确性方面仍然落后。
成本。GPT Realtime 2 的定价为每百万 token 32 美元/64 美元,这一价格在呼叫中心的通话量面前根本站不住脚。Mercury 2 的定价为输入 $0.25/M,输出 $0.75/M,折算下来大约是每分钟对话半分钱。
假设一个生产级语音智能体配置:每分钟约 4 轮对话;约 2,000 token 的系统提示词,加上每轮重新发送的不断增长的历史对话记录(每分钟对话约 20,000 输入 token);每分钟约 600 输出 token,包括推理 token(每轮约 50 个语音回复 token 和约 100 个推理 token)。Mercury 2 标价为输入 $0.25/M、输出 $0.75/M。仅含模型层成本;不含 STT、TTS 和电话通信。
级联式流水线依然流行,但一直缺少的是一个能实时推理的大脑。作为兼容 OpenAI API 的端点,Mercury 可以直接接入你现有编排栈中的 LLM 位置——LiveKit、Pipecat、Vapi、Retell,或你自己的方案。
下一步
实时推理改变了语音智能体的能力边界。我们一直在与语音平台和企业合作,探索更长的上下文、前沿的工具调用性能,以及延迟感知的推理模式。
想看看 Mercury 2 如何处理你的提示词?API 已在 platform.inceptionlabs.ai 上线。正在对生产环境语音延迟进行基准测试?我们会提供更高吞吐量的容量,让你能在自己的负载上测量真实性能。联系我们的团队。
来源:Inception Labs:Blog(网页) · inceptionlabs.ai