跳到正文
北京时间
原文
Hugging Face:Blog(RSS)·· 2026-06-01精选AI 评分71

JetBrains 发布 Mellum2:12B 参数混合专家模型

Introducing Mellum2: A 12B Mixture-of-Experts Model by JetBrains

AI 导读

Mellum2 是 JetBrains 从头训练的 12B 参数混合专家(MoE)模型,专注于自然语言与代码。每个 token 仅激活 2.5B 参数,推理速度可达同类模型的 2 倍以上,适合高吞吐、低延迟场景。该模型支持路由、RAG、摘要、子智能体及私有部署,以 Apache 2.0 许可证开源。在代码生成、推理、科学和数学基准测试中,Mellum2 与同等规模的开放模型竞争力相当。

推荐理由

JetBrains 开源了 Mellum2,一个激活参数仅 2.5B 的 12B MoE 模型,专为代码和问答管道设计的快模型。做实时 RAG 或子代理时,终于不用硬扛大模型了。

正文 · AI 翻译
  • Mellum2 是一个 12B 参数的混合专家模型,从零开始在自然语言和代码上训练。
  • 该模型每个 token 仅激活 2.5B 参数,因此在高吞吐、低延迟推理方面十分高效。Mellum2 可用于路由、RAG、摘要、子智能体、高吞吐编程功能以及私有化部署。
  • 该模型以 Apache 2.0 许可证发布。
  • 与同等规模的模型相比,Mellum2 在基准测试中展现出有竞争力的性能,同时推理速度提升超过 2 倍。
  • 在 Hugging Face 上下载该模型:https://huggingface.co/collections/JetBrains/mellum-2
  • 有关架构细节、训练设置、基准测试和评估方法,请阅读完整技术报告:https://arxiv.org/pdf/2605.31268

今天我们发布 Mellum2,这是一个开放式的混合专家模型,针对低延迟的文本与代码工作负载进行了优化。Mellum 最初是一个代码补全模型。借助 Mellum2,我们将这一基础扩展到更广泛的自然语言和软件工程任务,同时让模型专注于高效推理和可部署性。现代 AI 系统越来越依赖多次模型调用:路由、检索、摘要、规划、验证和工具使用。其中许多操作对延迟敏感,且并不需要最大的可用模型。Mellum2 正是面向这些工作负载。

基准测试亮点

在我们的技术报告中,我们从代码生成、推理、科学和数学基准测试方面对 Mellum2 进行了评估。Mellum2 与同等规模的开放模型相比具有竞争力,同时推理速度提升超过 2 倍,使其适用于高吞吐量的生产工作负载。模型架构 Mellum2 是一个混合专家(MoE)模型:

模型 总参数量 每 token 激活参数量 模态 许可证
Mellum2 12B 2.5B 文本与代码 Apache 2.0

MoE 架构在保持模型总容量较高的同时,每个 token 仅激活一部分参数。这使得推理更加高效,并有助于降低实时工作负载的服务成本。Mellum2 有意聚焦于文本和代码,而非多模态任务。这种专精化使模型保持紧凑高效,适用于软件工程工作负载。

主要用例

路由与编排

Mellum2 在多模型系统中可出色地充当轻量级路由与编排模型,包括提示词分类、工具选择以及中间控制流步骤。

RAG 流水线

该模型非常适合对延迟敏感的检索流水线,包括上下文压缩、摘要生成以及检索后处理。

子智能体

Mellum2 可用于智能体子任务,如规划、验证、转换和上下文准备,从而减少为中间操作调用更大模型的需求。

私有化部署

由于 Mellum2 是开放的且服务效率高,它可以部署在涉及专有代码或内部数据的自托管环境中。

为什么范围明确的模型很重要

随着 AI 系统日趋成熟,最有效的架构正变得不再那么 monolithic。单个前沿模型可以很强大,但生产系统往往需要多个专门化组件协同工作:检索器、路由器、代码感知模型、验证器、工具调用器,以及更大的推理模型。我们把 Mellum2 视为一个“焦点”模型:一个快速、范围明确的模型,针对更大 AI 系统内的高频任务进行了优化。目标不是取代技术栈中的每一个模型。目标是让整个技术栈更快、更便宜、更易于控制。

Mellum2 快速上手

如果你正在为软件工程构建 AI 系统——无论是在 IDE 内、在 RAG 流水线中、作为智能体工作流的一部分,还是部署在私有基础设施上——Mellum2 都可以立即试用。

来源:Hugging Face:Blog(RSS) · huggingface.co