2026年夏季开源模型生态观察:中国前沿模型规模领先,AMD与NVIDIA主导发布量
State of Open Models: Summer 2026 Observations
2026年1至8月,Hugging Face公开模型仓库从243万增至296万,但85.6%的模型下载量不足200次,1.5%的仓库占据99.2%下载量。中国实验室月度最大开源模型参数规模在754B至2.78万亿之间,美国实验室七个月中五个月低于130B。AMD与NVIDIA各发布超200个新模型仓库,成为发布开源模型最多的机构。
下载量与点赞量分别记录实际依赖和社区兴奋点,把两者混为同一个热度指标是评估开源模型生态时最常见的偏差。
在 AI 领域,时间仿佛被压缩了。在我们半年一度的生态分析中发布春季报告仅仅几个月后,截至今年夏天,我们又观察到了不少新发现。本报告梳理了 2026 年 1 月至 8 月期间的这些观察结果,并逐一呈现背后的数据。
HF Hub 上的模型和数据集每天都在增长。在此期间,公开模型仓库从 243 万增长到 296 万,数据集从 71.1 万增长到 100 万,Spaces 从 100 万增长到 144 万。其底层的分布依然极端:约 85.6% 的模型累计下载量不足 200 次,而 1.5% 的仓库贡献了全部下载量的 99.2%。下文所述的一切都发生在这种分布格局之内。
1. 前沿正在快速推进
过去存在一条清晰的进阶路径:实验室通常先发布较小的模型,再逐步向规模顶端推进。而在 2026 年,多家中国实验室完全跳过了这一路径。
在 2026 年的几乎每一个月里,中国实验室发布的最大、性能最强的开源模型,其规模都超过了美国实验室同期自行发布的任何模型。中国的月度规模上限介于 754B 到 2.78 万亿参数之间;而美国的自身规模上限在七个月中有五个月都低于 130B,例外是 5 月和 6 月 NVIDIA 发布的 Nemotron 3 Ultra(561B),以及 Thinking Machines Lab 的 Inkling。
这张图表将各实验室分为两大阵营。月之暗面(Moonshot)、MiniMax、小米和Z.ai几乎不发布70B以下参数的模型,因此开发者首次接触它们时,面对的都是大到无法在自己设备上运行的模型。而腾讯和阿里巴巴通义千问(Qwen)则覆盖了从不足1B到更大参数的全谱系。
有两件事让第一类阵营成为可能。首先,构建大模型不再是什么差异化优势。小米和美团今年都突破了万亿参数大关,而十二个月前它们在开放权重领域还并非家喻户晓的名字。其次,实验室不再需要发布小模型来触达用户,因为社区的量化层会在几天内让大模型变得可运行——这一点我们稍后会再讨论。
这样一来,模型尺寸分布便成了一种意图声明,而非能力声明。只做前沿模型的组合,意味着把一切都押在基准测试排名和API需求上。而全谱系模型组合,则是为了成为开发者标准化所依赖的模型家族。两种策略都合理,它们争夺的是不同的奖赏。
与此同时,美国并未缺席开源领域。
今年发布新开源模型数量最多的两家机构,恰恰也是硬件制造商:AMD 和 NVIDIA。两家各自发布了超过 200 个新模型仓库,遥遥领先于其他机构,LiquidAI 以约 100 个的数量排名第三。硬件厂商已经意识到,开源模型是卖芯片的一种方式:一个针对你的硬件优化且免费开放的模型,就是证明该硬件确实好用的最有力证据。
当把较小的模型和嵌入向量模型也纳入统计时,Google、Microsoft、IBM Granite 以及 OpenAI 较早期的视觉和语音模型每年都能产生数亿次下载,美国在开源 AI 领域的参与度仍在增长。
然而,重心已经发生转移。在新模型发布方面,Google 和 Meta 如今的排名已远低于 NVIDIA,尽管这两家公司在前几年曾定义了开放模型发布的格局。Meta 转向封闭旗舰模型的做法进一步凸显了这一变化。开源已从模型实验室转移到硬件与基础设施公司手中。
在前沿规模层面,情况则截然不同。今年美国发布的超过 100B 参数模型中,大多数并非全新模型,而是基于中国模型构建的。在这一规模上,仅有少数几个重要的美国原创模型出现:Thinking Machines 的 Inkling(952B)、NVIDIA 的 Nemotron 3 Ultra(561B)、Nemotron 3 Super(124B)以及 Arcee AI 的 Trinity-Large(399B)。
AMD 贡献了大量模型转换工作,但并未在此规模上推出原创模型。这项工作仍然重要:它使万亿参数的中文模型能够在美系硬件上高效运行。但它代表的更多是分发与优化层,而非模型创造。
与此同时,中国的开源模型正越来越多地针对国产芯片进行优化,这同样是反向的竞争——模型围绕特定的硬件生态来设计。
2. 关注度 ≠ 采用度
我们选取了今年累计下载量排名前 25 的模型仓库,以及点赞量排名前 25 的模型仓库。两个榜单中恰好只有一个仓库同时上榜。
我们统计的是统计窗口内的下载量,而非累计下载量,因此仅仅因为存在时间更长并不会获得额外加分;而控制模型年龄后,这种分化更加明显。2026 年发布的模型没有一个进入下载量前 25,而 25 个上榜模型中却有十三个发布于 2022 年。all-MiniLM-L6-v2 在七个月内被下载了 15.5 亿次,对应 5,156 个点赞;而 Kimi-K3 平均每个点赞对应的下载量约为 60 次。
这两个数字记录的是不同的行为。点赞表示某个发布版本很重要,并且会在模型发布后的几周内流向前沿模型。下载则意味着某个东西被接入了一条按计划运行的流水线,并且会在数年间累积到小型、稳定的模型上。点赞是衡量这个领域对什么感到兴奋的正确工具,而下载则是衡量它当前依赖什么的正确工具。把其中任何一个当作另一个的替代指标,是我们在报道 Hub 时看到的最常见错误,包括我们自己的早期工作也是如此。同样的分化也出现在发布者层面。
中国的前沿实验室是 Hub 上仅有的几个“重载带”承载了主要下载量的账号。MiniMax 在 2026 年的下载量中,实际上全部来自 70B 以上的模型,Moonshot 的这一比例为 88%,DeepSeek 为 55%,Z.ai 为 39%。没有任何大型美国账号呈现这种形态:Google、Microsoft 和 IBM Granite 在 2026 年的下载量中,70B 以上的模型几乎为零,而 NVIDIA 和 Meta 分别只有 14% 和 9%。
这种差异在总下载量上变得更加清晰。Moonshot 仅发布前沿模型的组合全年录得 3700 万次下载,而 Qwen 跨模型规模的更广泛发布策略则达到了 20.45 亿次(在声明了参数规模的仓库中;若包含所有仓库则为 20.61 亿次),大约是前者的 55 倍。该模型家族的持续扩展——从 2.4T 参数的 Qwen 3.8 Max 到 27B 等更小的变体——同样显示出对不同用例覆盖范围的重视。
时间也起着重要作用。大多数模型在发布后使用量会急剧下降,随后进入一段平稳活动的长尾期。一个模型的采用情况在很大程度上由其发布后的最初几个月决定。
这有助于解释为什么如今的下载量往往不是由最新发布的模型驱动,而是由一小部分随着时间推移已成为既定基础设施的模型所驱动。
3. 开放权重改变了价值积累的所在
如果前沿模型是一项授权许可业务,你会预期最大的发布版本附带最严格的条款。然而,下面的数据讲述了一个不同的故事。
今年中国发布的超过 200 亿参数的 178 个模型中,59% 采用 Apache 2.0 许可,22% 采用 MIT 许可,并且完全没有一个带有非商业性使用限制。
DeepSeek 和 Z.ai 以纯粹的 MIT 许可发布了参数规模在 7000 亿到 1.65 万亿之间的模型。中国实验室对其最大模型的授权方式几乎与其最小模型一样宽松,并且比美国实验室对其模型的授权更为宽松:在美国实验室同一规模区间的模型中,29% 采用 Apache 或 MIT 许可,41% 采用自定义条款,30% 则完全没有声明任何许可。
无论这些发布是为了什么,都不是为了许可收入。权重以现有最宽松的条款免费提供。回报必然来自其他地方:API 和云业务、硬件与平台定位,或者生态系统地位本身。例如,Z.ai 和 Kimi 的估值指向了一种有效的开源战略,在社区中获得了牵引力和增长机会。然而,展望未来,该行业可能会转向从开源采用中实现更清晰的变现路径。
4. Qwen 已成为社区的基础模型
一个模型的生态位不仅由其自身的发布决定,更取决于社区在其之上构建的规模。如上所述,Qwen 是一个例外,它正获得越来越多的关注与采用。
数据来源:Hugging Face
以此衡量,Qwen 已成为开放模型生态中最大的基石之一。基于 Qwen 的模型目前在 Hub 上已占 151,448 个衍生模型,是 Meta 全部模型足迹的 2.6 倍,更是 Llama 仓库数量的 4.7 倍。Google 以 82,506 个衍生模型紧随其后。第三大来源是 Unsloth,这是一个发布量化版和可直接微调构建的社区账号,其中许多构建进一步扩展了 Qwen 生态。
在 2026 年的前七个月中,Qwen 衍生模型以每天约 180–210 个新仓库的速度增长,这表明其采用并非仅由个别发布所驱动。Qwen 已成为开发者决定微调和部署哪些模型时的默认工作流的一部分。
多个因素共同造就了这一地位。首先是连贯性。Qwen 保持着规律的发布节奏,持续更新其模型家族,而非依赖偶尔的旗舰级发布。其次是覆盖面。它发布的模型覆盖了广泛的尺寸和用例,让开发者无论需要小型本地模型还是规模更大的部署模型,都能留在同一个生态体系内。第三是开放性。Apache 2.0 许可降低了修改、再分发和商业使用的门槛。
这些因素相互强化。庞大的模型家族吸引更多开发者;更多开发者创造出更多衍生模型;而这些衍生模型又让该生态体系对未来用户更具吸引力。
这一地位很大程度上是由社区建立的。151,448 个衍生模型代表的是其他开发者创造的下游成果,而非 Qwen 自身发布的版本。即使在 Hub 上 Qwen 模型的 28,531 个 GGUF 转换版本中,Qwen 官方也只发布了 54 个。
5. 小型模型仍是实际应用的载体层
在声明了参数量的模型中,低于 1B 的模型占据了历史总下载量的 83%,而 100B 以上的模型仅占 1%。即便只看 2026 年累积的下载量,结果也没有变化:超过 70B 的模型仅占总量的 3%。这是三月份发现中保持得最稳固的一项,原因与此前相同——小型模型是唯一能在大多数开发者实际拥有的硬件上运行的模型。
那么,一个万亿参数模型究竟是如何触达用户的?答案是:通过 llama.cpp。
今年 2 月,ggml 团队加入了 Hugging Face,该项目继续保持完全开源、由社区治理,技术方向也保持不变。变化在于,这个本地推理领域最重要的项目如今有了可持续的资源支持。
llama.cpp 把天花板抬高了。7 月的快照中包含了 DeepSeek-V4-Flash(约 284B 参数)和 Kimi-K3(约 2.8 万亿参数)的 GGUF 构建版本。本地推理过去意味着在笔记本电脑上跑一个 8B 模型,如今则意味着将万亿参数的混合专家模型分散在几台消费级设备上运行——这是一年前前沿领域并不存在的另一条路径,也正是“前沿模型优先发布”策略能够成立的原因。
而这条路径跑在 Qwen 上:每月 3960 万次 GGUF 下载,几乎是 Gemma(2080 万)的两倍,是 Llama(750 万)的五倍多。与 Llama 的差距并非供应问题——Llama 衍生的 GGUF 仓库数量略多于 Qwen。同样的货架空间,流量却只有五分之一。
在这七个月里,模型仓库增长了 21.5%。而围绕它们的一些周边事物,增长速度则是其数倍。
声明使用 gguf 库的仓库增长了 464%,lerobot 增长了 194%,Apple 的 mlx 增长了 148%,而 transformers 和 peft 仅增长 16%,diffusers 增长 21%。建模核心的增长速度大致与平台平均水平相当。而决定模型实际能在哪里运行的层面——本地推理格式、Apple 芯片、机器人控制栈——其增长速度是前者的三到七倍。
在规模最大的十个模型家族中,其背后的实验室发布的官方 GGUF 转换版本寥寥无几。然而,GGUF 版本往往是开发者本地运行模型时实际使用的版本。在发布时提供官方转换版本、记录量化选择,并对产物进行签名,所需额外投入其实有限。与其在内部维护这套流程,实验室不妨与 Unsloth 等现有生态贡献者合作。这样做将缩小模型创建者所测试的权重与更广泛社区所采用版本之间的差距。
6. 智能体成为新用户
我们在三月还写不出这一节,因为当时这一工具尚不存在。agent-usage 数据集于七月发布,记录了编码智能体通过 huggingface_hub 或 hf CLI 调用 Hub 时发送的智能体/token——包括搜索模型、推送数据集、运行 Jobs、创建 Spaces。我们第一次能够看到 Hub 接收了多少智能体流量,以及这些流量来自哪些框架。
Claude Code 在七月以 44.4% 的份额领先,但单月数据掩盖了真正的发现:它在四月占 67.8%,五月跌至 6.4%,而 Codex 则从 10.4% 稳步攀升至 20.8%。这是一个没有在位者的市场,一次发布或一个默认设置的改变,就可能在单月内移动一半的流量。
第二个发现是未注册的流量来源。7 月份,在带有智能体标记的流量中,近四分之一来自数据集中尚未命名的工具框架,而在 5 月份这一数字为 59.8%。从 4 月到 7 月,出现了十多个新的客户端标识符。新进入者的出现速度超过了任何注册表为其命名的速度——这本身就是发现本身。
今年我们花了大量时间服务于这类读者,而不仅仅是人类浏览器。3 月份,论文开始提供机器可读的 Markdown 格式。4 月带来了智能体轨迹作为一级数据集类型,并在每个 Gradio Space 上提供了 agents.md 端点,使智能体能够读取 Space 的 API 并直接调用它。7 月,我们在 MCP 服务器上推出了hf_fs 工具,通过一个仅需一千多个 token 的单一接口即可访问仓库、存储、文档和论文,同时还提供了可附加的安全沙箱用于安全执行。同样的整合也发生在协议层面,MCP 已并入 Linux 基金会的 Agentic AI Foundation。
然后,在 7 月,一个智能体不再只是读者,而变成了入侵者。一起看似是首个有记录的、自主智能体主动发起持续入侵的案例,发生在了我们身上。当我们团队试图使用前沿闭源模型来分析捕获的攻击代码时,它们的安全护栏拒绝了这项任务。最终,分析是在我们自己的基础设施上运行的一个量化开源模型 GLM-5.2 上完成的。我们发布了披露声明和完整的技术时间线。
展望未来
与春季报告相比,地缘力量的再平衡持续加速。在美国开源模型继续推进的同时,中国数家前沿模型之间的竞逐也引起了社区的高度关注。这些前沿模型收获的大量点赞,正指向社区最感兴趣的方向,也为那些借助这股关注度提升估值的公司带来了增长机遇。
然而,AI 竞赛不仅是短跑,更是一场马拉松。像 llama.cpp 这样的工具有助于在本地部署大型模型,但一个广泛的模型家族及其生态采纳仍是关键,这样才能在开发者、发布方与未来用户之间建立起正向反馈循环。能够嵌入基础设施并成为生态系统一部分的模型,或许才能在隧道尽头迎来商业上可行的出路。
最后,智能体首次成为 HF Hub 上的头号用户群体,下一份报告的面貌可能也会大不相同。
因为在 AI 领域,短短几个月就可能重塑整个生态格局。
方法说明
本分析基于 2026 年前七个月在 Hugging Face Hub 上观察到的活动数据。
本报告使用的各项指标,包括下载量、点赞数、衍生模型数量与模型发布数量,分别代表生态活动的不同侧面。它们不应被解读为模型质量、商业采用度或整体市场份额的直接衡量标准。
下载量反映的是 Hub 生态系统内的使用情况,但并不涵盖 API 调用、私有部署或通过其他渠道分发的模型。
点赞数体现了社区的关注度和兴趣,而衍生模型则提供了开发者在现有模型基础之上进行二次开发程度的信号。
由于开源 AI 的采用发生在多种渠道中,Hub 上的活动应被视为观察生态系统发展的一个视角,而非对 AI 市场的完整度量。
来源:Hugging Face:Blog(RSS) · huggingface.co