跳到正文
北京时间
原文
Mistral AI:News(网页)·· 2026-03-16精选AI 评分72

Mistral 发布 Mistral Small 4:统一推理、多模态与编码能力并开源

Mistral Small 4

AI 导读

Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可开源。

推荐理由

原文给出完整的架构参数、推理档位设置和与 GPT-OSS 120B 的输出长度对比,读者可以据此评估部署成本和适用场景。

正文 · AI 翻译

今天,我们宣布推出 Mistral Small 4。该模型是 Mistral Small 系列的下一个重要版本。Mistral Small 4 是首个将我们旗舰模型的能力统一到单一多用途模型中的 Mistral 模型,这些旗舰模型包括用于推理的 Magistral、用于多模态的 Pixtral,以及用于智能体编程的 Devstral。借助 Small 4,用户不再需要在快速指令模型、强大推理引擎或多模态助手之间做出选择:一个模型现在即可提供全部三种能力,并具备可配置的推理强度和业界一流的效率。

Mistral Small 4 在 Apache 2.0 许可证下发布,延续我们对开放、可访问且可定制 AI 的承诺。

多模态、推理优化模型的新标准

Mistral Small 4 是一款针对通用聊天、编程、智能体任务和复杂推理优化的混合模型。其架构支持文本和图像输入,使其适用于广泛的应用场景。通过 Mistral Small 4,我们重申对开源模型的承诺,并自豪地作为创始成员加入 NVIDIA Nemotron Coalition,推动 AI 开发中的协作与创新。

关键架构细节

  • 专家混合(MoE):128 个专家,每个 token 激活 4 个,实现高效扩展与专业化。

  • 总参数 119B,每个 token 激活 6B 参数(包含嵌入和输出层为 8B)。

  • 256k 上下文窗口,支持长篇幅交互和文档分析。

  • 可配置推理强度:在快速、低延迟响应与深度、推理密集型输出之间切换。

  • 原生多模态:同时接受文本和图像输入,解锁从文档解析到视觉分析的各种用例。

性能亮点

  • 端到端完成时间减少 40%(延迟优化配置)。

  • 与 Mistral Small 3 相比,每秒请求数提升 3 倍(吞吐优化配置)。

Performance Comparison Across Internal Models

为什么选择 Mistral Small 4?

统一能力

Mistral Small 4 将 Magistral(推理)、Devstral(编程智能体)和 Mistral Small(指令)的优势整合到单一模型中。无论你需要聊天助手、研究伙伴还是编程智能体,Small 4 都能适应你的任务,无需在专用模型之间切换。

按需推理

借助新的 reasoning_effort 参数,用户可以动态调整模型行为:

  • reasoning_effort="none":快速、轻量响应,适用于日常任务,等同于 Mistral Small 3.2 的相同聊天风格。

  • reasoning_effort="high":针对复杂问题进行深度、逐步推理,详细程度与之前的 Magistral 模型相当。

Performance Comparison Across Internal Models 2   Alt

企业级效率

  • 最低基础设施:4x NVIDIA HGX H100、2x NVIDIA HGX H200 或 1x NVIDIA DGX B200。

  • 推荐配置:4x NVIDIA HGX H100、4x NVIDIA HGX H200 或 2x NVIDIA DGX B200,以获得最佳性能。

  • Mistral Small 4 完全开源。可针对专门任务进行微调,或开箱即用地部署用于通用场景。得益于与社区的合作,它现已在 vLLM、llama.cpp、SGLang、Transformers 等平台上可用。

  • 交付先进的开源 AI 模型需要广泛的优化。通过与 NVIDIA 的紧密合作,推理已针对开源 vLLM 和 SGLang 进行了优化,确保在各种部署场景下实现高效、高吞吐的服务。

图:三个基准测试中的得分与输出长度对比。上:准确率得分(越高越好)。下:平均输出长度,以千字符计(越短越好)。

具备推理能力的 Mistral Small 4 取得了有竞争力的分数,在所有三个基准测试中与 GPT-OSS 120B 持平或超越,同时生成的输出显著更短。在 AA LCR 上,Mistral Small 4 仅用 1.6K 字符就得到 0.72 分,而 Qwen 模型需要 3.5-4 倍的输出(5.8-6.1K)才能达到相当的性能。在 LiveCodeBench 上,Mistral Small 4 在输出少 20% 的情况下超越了 GPT-OSS 120B。这种效率差距在实践中很重要:更短的输出意味着更低的延迟、更少的推理成本和更好的用户体验。

对于企业买家:


每个 token 的效率直接影响成本和可扩展性。随着响应变长仍能保持或提升性能的模型,减少了对人工干预的需求,降低了运营成本,并确保了一致的质量,即使对于报告生成、客户支持或决策工作流等复杂、高风险的任务也是如此。混合推理模型通过在不按比例增加资源使用的情况下最大化准确率,提供了更好的价值,使其成为性能和成本效率都至关重要的大规模部署的理想选择。

对于技术团队和数据科学家:


每个 token 的性能是模型选择和优化的关键指标。能够高效扩展的模型使团队能够为更长、更细致的任务(例如详细分析、多步推理)部署解决方案,而不会牺牲准确率或增加计算成本。这意味着在质量和资源分配之间的权衡更少,从而实现更具创新性和可靠性的 AI 驱动应用。它还简化了微调和集成,因为模型的稳健性减少了对持续调整或回退系统的需求。

预期用例

Mistral Small 4 专为以下场景设计:

  • 开发者:编码自动化、代码库探索和代码智能体工作流。

  • 企业:通用聊天助手、文档理解和多模态分析。

  • 研究人员:数学、研究和复杂推理任务。

其开源许可证和可定制架构使其成为微调和专业化的理想选择。

可用性

  • Mistral API 和 AI Studio

  • Hugging Face 仓库

  • 开发者可以在 NVIDIA 加速计算平台上免费试用 Mistral Small 4,网址为 build.nvidia.com;对于生产部署,Mistral Small 4 作为 NVIDIA NIM 在 day-0 即可使用,开箱即提供优化的容器化推理。它还可以通过 NVIDIA NeMo 进行定制,以实现特定领域的微调。

  • 面向客户的技术文档可在我们的 AI Governance Hub 上获取

对于企业部署、自定义微调或本地部署解决方案,请联系我们的团队。

AI 的未来是开放的

通过统一指令、推理和多模态能力,Mistral Small 4 简化了 AI 集成,使用户能够借助单一、可适应的工具处理更广泛的任务,将开源 AI 的优势带入现实世界的用例中。

来源:Mistral AI:News(网页) · mistral.ai