Artifacts 22:Zyphra、Cohere 和 Poolside 正在扩展生态系统广度
Artifacts 22: Zyphra, Cohere, and Poolside are expanding the breadth of the ecosystem
开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea、Photoroom 则训练高度专业的小模型。NVIDIA 发布 Nemotron-3-Ultra-550B-A55B-BF16,采用 LatentMoE 架构并改用 OpenMDW 许可证。Cohere 以 Apache 2.0 开源其旗舰模型 Command A+(05-2026-bf16),这是一款 218B-A25B MoE 模型,具备多模态、多语言和智能体能力。
这篇文章把开源模型玩家拆成三类,清晰解释了不同动机,Cohere 转向 Apache 2.0 和 NVIDIA 采用 OpenMDW 是许可层面的重要信号,关注开源的值得一读。
对开放生态及模型发布背后动机的评估
Florian Brand
以及
我们在开放模型发布中持续看到的一个趋势是,生态正变得更加多元,越来越多的机构在发布各种各样的模型。一年前,开放产物以及更广泛的开放模型格局由少数(中国)玩家主导。这一局面已经改变,我们越来越多地收录来自世界各地更为细分的公司。
虽然很难确知这些公司自身的确切动机,但我们可以大致观察到以下几类:
“纯粹”的模型制作者:这些公司公开宣称的目标是训练处于前沿、或至少接近前沿的模型。这包括许多中国公司,如 DeepSeek、智谱和 MiniMax,也包括 Poolside、Arcee 和 Zyphra 等西方公司。它还越来越多地包括主权 AI 玩家,如 Cohere、Sovereign、Mistral 和 Trillion Labs。最近的 Mythos 事件唤醒了一些政策制定者,这可能会带来对主权模型训练更多的兴趣。
大型科技公司:对于大型科技公司而言,包括阿里巴巴的通义千问、Google 的 Gemma,以及在一定程度上包括 NVIDIA,其动机更为多样。阿里巴巴利用模型发布来为其闭源模型做追加销售,而 NVIDIA 则受益于繁荣的开源模型生态,因为这提升了对其 GPU 的兴趣和使用量。这种利益绑定不同于西方开源模型的 Llama 时代,当时开源发布的动机不那么清晰(最终也未能成立)。
产品公司:一些公司,如 JetBrains、Zed、Krea 和 Photoroom,主要销售以 AI 为核心组件的产品。由于它们不想被切断对闭源模型的访问,或者想要提供独特的东西,它们可以训练高度专业化的小型模型来满足其产品需求。因此,将这些模型权重开源并不会损害它们的利润。
这种开发者和模型的多样性符合我们的假设,即更多公司将开发长尾模型,而追逐绝对开源前沿的公司数量将会减少。
虽然并非每一次模型发布都能整齐地归入上述某一类别,但更宏观的要点是,开源模型的发展并非由单一类型的参与者或动机所驱动。这种多样性是开源生态的优势之一,并且可以从模型发布的技术报告中看出——这些报告复用了其他开源模型发布中的训练方法、架构选择和数据。
试图减缓或禁止这一生态系统的做法,不仅如科技相关禁令的历史所表明的那样是徒劳的,而且是不安全的、反自由的。此类限制会把 AI 的开发和使用集中到少数人手中,最终危及外部人士自由采用我们这一生中最重要的技术之一的能力。
我们的精选
NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 由 nvidia 发布:这是 Nemotron 系列的大版本,采用 LatentMoE,速度甚至比同类模型更快。与其他 Nemotron 模型一样,绝大部分数据都是开源的。而且最重要的是:NVIDIA 承诺采用 OpenMDW 许可证,该许可证专为模型权重(和数据)量身定制,并放弃了其自定义许可证。虽然 MIT 和 Apache 与 OpenMDW 精神相同,但只有后者真正覆盖模型权重,而前者是软件许可证,并不真正适用于模型权重。
command-a-plus-05-2026-bf16 由 CohereLabs 发布:Cohere 近来正越来越频繁地出现在 Artifacts 中,此次以 Apache 2.0 发布了其旗舰模型 Command A+。该系列此前的版本一直以非商业许可证发布,因此这一变化非常令人欢迎!Command A+ 以 218B-A25B MoE 的形式融合了多模态、多语言和智能体能力,使其在使用 4-bit 时可在单块 B200 上运行。
GLM-5.2 由 zai-org 发布:本期 Artifacts 中最大的新闻是 GLM-5.2,我们也在另一篇博客中进行了报道。该模型持续令人印象深刻,并且真正可用于日常工作,与当前可用的最佳闭源模型相比并没有大幅退步。有趣的是,发布以来的原始下载量与其他模型发布更为一致,GLM-5.2 在发布后大致与 GLM-5 持平。
ZAYA1-74B-preview 由 Zyphra 发布:Zyphra 在 AMD GPU 上进行训练,因其技术报告中有趣的架构选择而被研究社区视为某种内部消息来源,他们发布了一些新模型,其中 74B-A4B MoE 和 8B-A0.6B MoE(技术报告)是他们当前的旗舰发布。
Laguna-M.1 由 poolside 发布:我们在上一期 Artifacts中报道过的 Poolside,也以 Apache 2.0 协议发布了他们的旗舰模型!他们还承诺今后将持续开放发布:
开放权重现在是我们的默认选择。我们将继续向前沿推进,并持续在开放环境中发布能力越来越强的模型。
模型
通用
Kimi-K2.7-Code 由 moonshotai 发布:Kimi 的一次更新,重点大幅优化了 token 效率。
Step-3.7-Flash 由 stepfun-ai 发布:Step-Flash 的一次更新,尤其在数学方面表现非常强劲。
Nemotron-Labs-Diffusion-14B 由 nvidia 发布:一个实验性模型,可用于三种不同模式:自回归、扩散模型和自推测。每种模式都适用于不同的使用场景。
来源:Nathan Lambert:Interconnects(RSS) · interconnects.ai