Inception Labs 推理模型 Mercury 2 上架 Azure AI Foundry
Mercury 2 on Azure Foundry
Inception Labs 宣布 Mercury 2 在 Azure AI Foundry 上线,称其为基于扩散架构的快速推理语言模型,通过并行细化生成而非逐词解码。
官方宣布扩散架构推理模型登陆 Azure,给出具体速度、价格和企业级部署细节,可供评估生产部署选项。
今天,我们非常激动地宣布,Mercury 2 已在 Azure AI Foundry 上线,这是全球最快的推理语言模型,旨在让生产级 AI 体验变得即时。此次发布将 Inception 的突破性扩散架构与 Azure 的企业级基础设施相结合,让开发者能够使用一个兼具卓越速度与质量的模型。
Mercury 由打造 Flash Attention、Direct Preference Optimization 以及原始图像扩散模型等基础 AI 技术的团队构建,它代表了语言模型生成文本方式的根本性转变。Azure AI Foundry 上的开发者现在可以使用一个在对延迟敏感、用户体验不容妥协的应用中表现卓越的模型。
全新的基础:用于实时推理的扩散
Mercury 2 不进行顺序解码。它通过并行细化生成响应,同时生成多个 token,并在少量步骤内收敛。与其说是打字机,不如说是编辑一次性修订整份草稿。结果是:生成速度提升 5 倍以上,且速度曲线从根本上不同。
这种速度优势也改变了推理的权衡。如今,更高的智能意味着更多的测试时计算——更长的链、更多的样本、更多的重试——而这是以延迟和成本为直接代价换来的。基于扩散的推理让你在实时延迟预算内获得推理级质量。
性能:速度与质量
Mercury 2 改变了生产部署的质量-速度曲线:
速度:在 NVIDIA Blackwell GPU 上达到 1,009 tokens/秒
价格:$0.25/1M 输入 tokens · $0.75/1M 输出 tokens
质量:与领先的速度优化模型相当
功能:可调推理 · 128K 上下文 · 原生工具调用 · 符合 schema 的 JSON 输出

我们针对用户真正能感受到的速度进行优化:用户所体验时刻的响应性——高并发下的 p95 延迟、一致的逐轮行为,以及系统繁忙时稳定的吞吐量。

Azure 上的企业级就绪
Azure AI Foundry 上的 Mercury 2 开箱即用,已为生产环境做好准备。它具备 128K token 上下文窗口,可处理大型文档并维持长时间对话,支持原生工具调用以及使用 JSON schema 的结构化输出,用于构建智能体工作流。该 API 与 OpenAI 兼容,使与现有代码库的集成无缝顺畅。
Azure AI Foundry 提供企业级基础设施,包括网络隔离、数据隐私保障(确保你的数据保留在你的 Azure 环境中,绝不用于训练)、包括 SOC2 和 HIPAA 在内的 Azure 合规标准,以及通过 Azure Monitor 和 Application Insights 提供的全面可观测性。
真实世界用例
Mercury 2 在对延迟敏感、用户体验不容妥协的应用中表现卓越:
编码与编辑:自动补全、下一步编辑建议、重构、交互式代码智能体——这些工作流中开发者处于循环之中,任何停顿都会打断心流。
智能体循环:智能体工作流每个任务会串联数十次推理调用。削减每次调用的延迟不仅能节省时间,还会改变你能负担运行多少步骤,以及最终输出能有多好。
实时语音与交互:语音界面在 AI 中拥有最紧张的延迟预算。Mercury 2 让推理级质量在自然语音节奏内变得可行。
搜索与 RAG 流水线:多跳检索、重排序和摘要的延迟会迅速叠加。Mercury 2 让你在搜索循环中加入推理,而不会超出延迟预算。
在 Azure AI Foundry 上部署

Mercury 2 通过 Azure AI Foundry 在美国和加拿大区域提供。部署非常简单——通过 Azure AI Foundry 的统一目录配置模型端点并设置你的基础设施。Mercury 2 软件许可证按固定小时费率收费,计算成本则根据你配置的资源通过你的 Azure 账户单独计费。
Azure AI Foundry 集成
Mercury 2 与更广泛的 Azure 生态系统无缝集成。使用 Azure AI Foundry 的模型目录进行部署,应用 Azure AI Content Safety 进行内容过滤,实时监控性能和成本,通过 Azure RBAC 和托管身份管理访问权限,并使用 Azure 的智能体框架构建多模型应用。
三步即可开始
前往 Azure AI Foundry 的 模型目录,搜索 Mercury 2,然后点击模型卡片。或者,你也可以访问我们的模型卡片 此处
点击 Use this model, 选择一个项目,然后按照 UI 提示配置你所需的容量。
虽然默认配置对大多数开发者来说应该够用,但我们建议选择 ND-H100-v5 实例以获得最佳速度。部署需要几分钟才能完成。
就是这样!你现在应该可以开始使用新配置的 API 端点进行构建了:
使用 Python
实时 AI 的未来
Mercury 在 Azure AI Foundry 上的发布标志着生产级 AI 应用的转折点。开发者不再需要在速度与质量之间、在实时响应能力与前沿模型能力之间做出取舍。
在 Azure AI Foundry 上部署 Mercury 2 →
如需详细文档、基准测试和集成指南,请访问 Azure AI Foundry 中的 Mercury 模型卡片。
来源:Inception Labs:Blog(网页) · inceptionlabs.ai