跳到正文
北京时间
原文
Inception Labs:Blog(网页)·· 2026-02-24精选AI 评分68

Inception Labs 发布扩散推理模型 Mercury 2

Introducing Mercury 2

AI 导读

Inception Labs 发布 Mercury 2,称其为最快的推理语言模型,基于扩散并行细化而非自回归逐 token 解码,生成速度较此前提升超 5 倍。

推荐理由

原文给出扩散架构带来的具体速度、价格和上下文参数,读者可据此评估实时推理场景的可行性。

正文 · AI 翻译

最快的推理 LLM,由扩散驱动

今天,我们推出 Mercury 2 —— 全球最快的推理语言模型,旨在让生产级 AI 感觉即时响应。

为什么现在速度更重要

生产级 AI 不再是一个提示对应一个答案。它是循环:代理、检索管道和提取任务在后台大规模运行。在循环中,延迟不会只出现一次。它会在每一步、每个用户、每次重试中累积。

然而当前的 LLM 仍然共享同一个瓶颈:自回归、顺序解码。一次一个 token,从左到右。

新基础:面向实时推理的扩散

Mercury 2 不进行顺序解码。它通过并行细化生成响应,同时产生多个 token,并在少量步骤内收敛。少一些打字机,多一些编辑一次性修改整份草稿。结果是:生成速度提升 5 倍以上,且速度曲线根本不同。

这种速度优势也改变了推理的权衡。如今,更高的智能意味着更多的测试时计算——更长的链、更多样本、更多重试——代价是直接的延迟和成本。基于扩散的推理让你在实时延迟预算内获得推理级质量。

Mercury 2 一览

Mercury 2 改变了生产部署的质量-速度曲线:

  • 速度:在 NVIDIA Blackwell GPU 上达到 1,009 tokens/秒

  • 价格:$0.25/1M 输入 tokens · $0.75/1M 输出 tokens

  • 质量:与领先的速度优化模型相当

  • 功能:可调推理 · 128K 上下文 · 原生工具使用 · 模式对齐的 JSON 输出

我们针对用户真正能感受到的速度进行优化:用户所体验时刻的响应性——高并发下 p95 延迟、一致的轮次间行为,以及系统繁忙时稳定的吞吐量。

“Inception 的 Mercury 2 展示了当新模型架构遇上 NVIDIA AI 基础设施时所能实现的可能性。在 NVIDIA GPU 上突破每秒 1,000 tokens,凸显了我们平台在驱动全方位 AI 工作负载方面的性能、可扩展性和多功能性。”

Shruti Koparkar,NVIDIA 加速计算集团产品高级经理

Mercury 2 在生产中解锁了什么

Mercury 2 在用户体验不容妥协的延迟敏感应用中表现出色。

1. 编码与编辑

自动补全、下一步编辑建议、重构、交互式代码代理——这些工作流中开发者处于循环中,任何停顿都会打断心流。

“建议来得足够快,感觉就像你自己思考的一部分,而不是你必须等待的东西。”

Max Brunsfeld,Zed 联合创始人

2. 代理循环

代理工作流每个任务会串联数十次推理调用。减少每次调用的延迟不仅能节省时间,还改变了你能负担运行多少步骤,以及最终输出能有多好。

“我们现在利用最新的 Mercury 模型来大规模智能优化广告活动执行。通过实时呈现洞察并动态增强投放,我们正在推动更强的表现、更高的效率,以及一个更具韧性、由 AI 驱动的广告生态系统。这一进步强化了我们对自主广告的承诺,即智能系统持续优化执行,为客户带来可衡量的成果。”

Adrian Witas,Viant 高级副总裁兼首席架构师

“我们一直在评估 Mercury 2,因为它拥有无与伦比的延迟表现和高质量,这对于实时转录清理和交互式 HCI 应用尤为宝贵。没有其他模型能接近 Mercury 所提供的速度!”

Sahaj Garg,Wispr Flow 首席技术官兼联合创始人

"Mercury 2 至少比 GPT-5.2 快两倍,这对我们来说是颠覆性的。"

Suchintan Singh,Skyvern 首席技术官兼联合创始人

3. 实时语音与交互

语音界面在 AI 中拥有最严苛的延迟预算。Mercury 2 让推理级别的质量在自然语音节奏内变得可行。

“我们构建能与真人进行实时对话的逼真 AI 视频化身,因此低延迟不是锦上添花,而是一切。Mercury 2 在我们的语音技术栈中是一次重大突破:快速、一致的文本生成,让整个体验保持自然和人性化。”

Max Sapo,Happyverse AI 首席执行官兼联合创始人

“Mercury 2 的质量非常出色,而且该模型的低延迟使语音代理响应更迅速。”

Oliver Silverstein,OpenCall 首席执行官兼联合创始人

4. 搜索与 RAG 流水线

多跳检索、重排序和摘要的延迟会迅速叠加。Mercury 2 让你能在搜索循环中加入推理,而不会超出延迟预算。

“我们与 Inception 的合作使我们搜索产品的实时 AI 变得切实可行。每一位 SearchBlox 客户,无论是在客户支持、合规、风险、分析还是电子商务领域,都能从对其所有数据的亚秒级智能中受益。”

Timo Selvaraj,SearchBlox 首席产品官

开始使用

Mercury 2 现已可用。

Mercury 2 兼容 OpenAI API。可直接接入你现有的技术栈——无需重写。

如果你正在进行企业评估,我们将与你合作,根据你预期的服务约束条件,进行工作负载适配、评估设计和性能验证。

Mercury 2 已上线。欢迎来到扩散时代。

来源:Inception Labs:Blog(网页) · inceptionlabs.ai