跳到正文
北京时间
原文
Hugging Face:Blog(RSS)·· 2026-03-18精选AI 评分78

Hugging Face开源现状:2026年春季

State of Open Source on Hugging Face: Spring 2026

AI 导读

Hugging Face发布了一篇关于其平台开源生态的博客文章。该文由Hugging Face官方撰写并发布在其自有平台上,内容聚焦于2026年春季的开源发展状态。文章具体分析了平台上的模型、数据集及开源社区活动趋势,但未提供详细的量化指标或具体产品发布信息。

推荐理由

Hugging Face 季度开源生态报告,可快速掌握 AI 开源社区最新动向与趋势

正文 · AI 翻译

本文审视了过去一年间,开源 AI 格局在竞争、地域、技术趋势以及新兴社区等方面所发生的变化。我们主要通过考察 Hugging Face 上社区活动的多种类型指标,来呈现该生态系统的全貌。本文基于 2025 年中进行的一项早期分析(可在此处查阅),该分析探讨了 Hugging Face 社区正在构建的内容。我们建议读者同时参考来自数据溯源计划、Interconnects、OpenRouter 与 a16z,以及麻省理工学院与 Linux 基金会等机构关于开源生态系统的其他视角。由于 Hugging Face 生态系统是分布式的,本文的分析是 Hugging Face 与社区成员共同工作的成果,每项贡献均已适当注明出处。

开源 AI 生态系统的活跃度迅速增长,用户数量、模型仓库和数据集仓库的数量均接近翻倍。2025 年,Hugging Face 的用户数增长至 1300 万,公开模型数量超过 200 万个,公开数据集数量超过 50 万个。这一增长不仅表明人们对开源的兴趣日益浓厚,更反映出一种向积极参与的转变——用户不再仅仅消费预训练系统,而是越来越多地创建衍生作品,例如微调模型、适配器、评测基准和应用。

数据来源:Hugging Face | Hugging Face 的 200 万个模型且仍在增长:图表与故事由 AI World 提供

该生态系统仍然高度集中。Hugging Face 上大约一半的模型总下载量不足 200 次,而下载量最高的前 200 个模型(占模型总数的 0.01%)却占据了所有下载量的 49.6%。

围绕特定领域、语言或问题领域形成了专业社区,这些社区即使总体下载量不高,也常常展现出持续的参与度和复用率。开源 AI 最好被理解为一组相互重叠的子生态系统,而非一个单一的同质化市场。

竞争中的开源

越来越多的大中小型企业正在基于开源进行构建。超过 30% 的《财富》世界 500 强企业现在在 Hugging Face 上拥有经过验证的账户。初创公司经常将开放模型作为默认组件:Thinking Machines 完全基于开放权重构建了其 Tinker 模型选项,而 VSCode 和 Cursor 等流行 IDE 同时支持开放和封闭模型。Airbnb 等美国老牌企业也增加了与开放生态系统的互动,Hugging Face 观察到,在 2025 年期间,更多传统企业升级了其组织订阅。

大型科技公司频繁在 Hugging Face Hub 上创建新的代码仓库;通过并排可视化对比,仓库数量的强劲增长显示出持续的投资力度。NVIDIA 已成为最突出的贡献者。

数据来自 Hugging Face | 大型科技公司全力投入开源 AI,图表与报道由 AI World 提供

对更广泛开源软件的研究表明,开放成果所创造的下游价值远超其生产成本。类似的动态正在 AI 领域显现,开放模型在数千个下游应用中被复用、适配和专业化。完全依赖封闭系统的组织往往成本更高,且在部署和定制方面灵活性更低。

开源的地理分布

过去四年的历史总下载量显示,模型受欢迎程度存在明显的领先地区。美国和历史上一直是顶级贡献者,英国、德国和法国在受欢迎程度上位居第二。由个人用户或没有明确地理基础的分布式组织开发的模型,占平台总下载量的约一半。

开源生态系统的地理构成已发生根本性变化。Hugging Face 数据显示,中国在月下载量和总下载量上均已超越美国。在过去一年中,中国模型迅速占据了下载量的多数份额,即 41%。

数据与图表来自 Hugging Face

行业在整体开发中的占比从 2022 年之前的约 70% 下降到了 2025 年的约 37%。与此同时,独立或非关联开发者在同期所有下载量中的占比从 17% 上升至 39%,有时甚至占到总使用量的一半以上。个人和小型团队专注于对基础模型进行量化、适配和再分发。这些中间环节如今在很大程度上引导着普通用户能够运行哪些模型,以及创新如何在生态系统中传播。

不同地区以不同方式做出贡献。美国和西欧历史上通过大型行业实验室(Google、Meta、OpenAI、Stability AI)占据主导地位,而中国在模型发布和采用方面日益领先。法国、德国和英国则继续通过研究机构、国家人工智能计划以及专业模型系列做出贡献。能够支持多样化贡献者和组织形式的生态系统,往往能产生更广泛被采用的成果。

国家、组织与个人用户

来自初创公司的热门模型更为普及。具有竞争力的国家是法国和韩国。值得注意的是,在开发新热门模型方面,排名第四的实体是个人用户,而非组织。在个人用户层面创建具有竞争力的模型比以往任何时候都更容易。

数据与图表来自 Hugging Face

中美之间

在 2025 年新创建的模型中,大多数热门模型要么是在中国开发的,要么是源自中国开发的模型。最受欢迎的模型由大型组织开发,主要来自美国和中国。欲了解更多关于中国人工智能生态系统的信息,请阅读我们的三篇系列文章,回顾自“DeepSeek 时刻”以来一年间的变化:第一篇关于战略变化,第二篇关于架构变化,第三篇关于组织与未来。

2025年,随着DeepSeek的R1模型在1月爆火,中国AI生态系统大力转向开源。发布模型的中国竞争性组织数量以及Hugging Face上的仓库数量激增。百度从2024年在Hub上零发布,到2025年发布超过100个。字节跳动和腾讯各自的发布量增长了8到9倍。此前偏好封闭路线的组织,包括百度和MiniMax,也果断转向了开源发布。

数据与图表来源:Hugging Face

数量相当的美国热门组织长期持续贡献了更高数量的仓库。Meta及其前Facebook研究机构占据了开源发布的很大比例,谷歌的贡献则相对较小。

数据与图表来源:Hugging Face

两相对比,中国热门组织仓库数量的急剧上升趋势,成为一项关键的战略差异。

数据与图表来源:Hugging Face

全球开源与主权

开源AI日益与主权问题挂钩。开放权重的模型允许政府和公共机构在国家法律框架下,基于本地数据对系统进行微调。可在国产硬件上部署的模型,减少了对国外控制云基础设施的依赖。模型架构、训练过程和评估的透明度,有助于监管审查和公共问责。在此了解更多关于主权问题的开源方法。

在国家层面,各国政府正在采取行动。韩国于2025年中启动的“国家主权AI倡议”,指定了LG AI Research、SK Telecom、Naver Cloud、NC AI和Upstage等国家冠军企业,以打造具有竞争力的国产模型。2026年2月,来自韩国的三个模型同时在Hugging Face Hub上进入热门趋势。2026年3月,韩国与美国初创公司Reflection AI宣布了一项数据中心合作,也将前沿开放权重模型引入韩国。

瑞士的瑞士人工智能倡议以及多个欧盟资助的项目也反映了类似的优先事项。英国的“公共资金,公共代码”原则已影响了几项政府支持的人工智能计划。

Hugging Face 热门页面 2026 年 2 月

这些对开源和开放权重人工智能的投资,已经为那些拥有自身蓬勃发展的 AI 训练生态系统的国家带来了回报,因为我们看到,模型和数据集通常在其开发的地区使用最多;开发者往往倾向于使用最能代表其语言、并反映相似技术和应用需求的模型。

来自 Hugging Face 的数据与图表

模型热度

Hub 上获赞最多的模型反映了社区的关注度,这体现在模型的可回溯性、可参考性或普遍受欢迎程度上。虽然这一指标并不总能反映实际使用情况,但随时间积累的关注度可以显示出兴趣信号。在一年之内,获赞最多的模型从主要由美国开发、来自 Meta 的 Llama 系列,转变为国际化的组合,其中中国的 DeepSeek-R1 位居榜首。

来自 Hugging Face 的数据与图表

论文与科学贡献

虽然衡量科学贡献的价值可以通过多种指标来确定,但我们在 Hub 上的点赞功能显示,来自大型 AI 组织的论文受到了社区成员的广泛赞赏。值得注意的是,获赞最多的论文来自大型组织,主要来自美国和中国。排名靠前的组织大多是中国的科技巨头公司,其中字节跳动贡献了大量高影响力的论文。

在 Hugging Face 的每日论文(由 Hugging Face 的 AK 策划的一组论文)中,那些涉及模型和数据集创建、并显示出最高开源采纳率的论文,通常具有多样性。显著的结论是,医学论文具有影响力,而大型科技公司的影响力则较为稀疏。

数据来自 Hugging Face | 图表与报道由 AI World 提供

衍生模型

我们的社区成员选择如何基于模型进行构建——无论是通过微调、合并还是其他方法——都反映了模型的受欢迎程度和可用性。阿里巴巴作为一家机构,其衍生模型数量超过了谷歌和Meta的总和,其中通义千问(Qwen)系列构成了超过11.3万个衍生模型。如果将所有标注为通义千问(Qwen)的模型都计算在内,这个数字会激增至超过20万个模型。

数据与图表来自 Hugging Face

采用与可及性

模型开发在追求规模的同时,越来越强调可及性。小型模型的下载和部署频率远高于超大型系统,这反映了围绕成本、延迟和硬件可用性的实际限制。

这种小型模型主导地位的部分原因是,该尺寸发布的模型数量要多得多。但即使对此进行归一化处理,来自ATOM项目“相对采用指标”的数据显示,参数规模在1B到9B之间的前10名模型的中位数下载量,仅比100B以上的模型高出约4倍。自动化系统和CI流水线进一步推高了小型模型的下载计数,但向更小、更易部署模型发展的趋势是真实存在的。

数据来自 Hugging Face | 图表与文章由 ATOM 提供

对开放模型的参与度通常在发布后立即达到顶峰,然后放缓。平均参与时长约为6周。持续改进和频繁更新对于保持相关性已变得至关重要。深度求索(DeepSeek)的连续发布(V3、R1、V3.2)使其在挑战者涌现时仍能保持竞争力。那些在开发上停滞不前的机构,其份额往往会迅速被那些频繁更新或拥有特定领域微调模型的机构所夺走。

已下载开放模型的平均参数规模从2023年的8.27亿上升至2025年的208亿,这主要得益于量化技术和混合专家(MoE)架构。然而,中位数参数规模仅从3.26亿小幅增长至4.06亿。这种差异表明,高端大语言模型(LLM)用户正在拉高平均值,而底层的小型模型使用量则保持稳定。

前沿模型与较小系统之间的性能差异,往往通过微调和特定任务适配而迅速缩小。在 Hub 上,拥有数亿参数的模型支持搜索、标签和文档处理工作流,而参数在数十亿级别的模型则广泛用于编码、推理和多模态任务。因此,大多数主流模型开发者现在都会发布涵盖多种尺寸的模型系列。高性能小模型的兴起,将自主性进一步推向边缘端,减少了对集中式云服务商的依赖。

算力、硬件与开源

开源 AI 的发展与硬件趋势紧密相连。大多数模型针对 NVIDIA GPU 进行了优化,但对 AMD 硬件的支持也在持续扩展。Stability AI 的模型集合现在同时针对 NVIDIA 和 AMD 平台进行了优化。各类库也越来越多地同时面向两者,相关工具链的改进使得跨硬件部署更加简便。2025 年,Hugging Face 推出了 Kernel Hub,用于加载和运行针对 NVIDIA 及 AMD GPU 优化的内核。

与此同时,中国开源模型在发布时也明确提供了对国产芯片的支持。阿里巴巴投资了专注于推理的芯片架构,旨在用能够本地运行开源模型的硬件来填充中国的数据中心。

尽管算力获取仍然是 AI 模型开发与部署的核心基础需求,但开源和开放权重模型正帮助打破那种将算力视为唯一决定因素的生态系统。越来越多各性能级别的模型,其效率提升使得成本降至大型开发者旗舰 AI 模型的十分之一到千分之一。

来自 Hugging Face 的数据与图表

尽管如此,开源领域的基础设施投资问题依然紧迫。为能够训练和提供开源模型的数据中心提供公共资金,已成为日益受到关注的政策议题,尤其是在欧洲和英国。大型闭源模型公司可用的计算资源与开源社区所能获取的资源之间的差距,持续影响着开源开发的可行性。

子社区:机器人技术

机器人技术已成为 Hugging Face 上增长最快的子社区之一。数据令人瞩目:机器人数据集从 2024 年的 1,145 个增长到 2025 年的 26,991 个,在短短三年内从 Hub 上排名第 44 位跃升至最大的单一数据集类别。作为对比,第二大类别——文本生成——在 2025 年仅有约 5,000 个数据集。

数据来源:Hugging Face | 图表与故事:AI World

社区贡献的数据集涵盖了从家庭操作任务到自动驾驶的方方面面。用于空间智能的最大多模态数据集——Learning to Drive(L2D)——是通过 LeRobot 与 Yaak 的合作发布的。像 RoboMIND 这样的数据集,包含超过 107,000 条真实世界轨迹,覆盖 479 个不同任务和多种机器人本体,为训练可泛化的机器人策略提供了所需的规模和多样性。

Hugging Face 对 Pollen Robotics 的收购,向工业界、学术实验室以及日常爱好者开放了开源机器人产品的销售。LeRobot,Hugging Face 的开源机器人库,提供了基于 PyTorch 的用于真实世界机器人的模型、数据集和工具,涵盖模仿学习、强化学习以及视觉-语言-动作模型,经历了快速增长。在过去一年中,其 GitHub 仓库的星标数几乎翻了三倍。

数据来源:GitHub | 图表来源:star-history.com

子社区:AI for Science

科学研究已成为另一个特别活跃的领域。开源模型和数据集越来越多地被用于蛋白质折叠、分子动力学、药物发现和科学数据分析。所有前沿 AI 公司现在都设有专门的科学团队,尽管目前大部分关注点仍集中在文献发现上,而非直接实验。

社区主导的项目围绕共同的研究目标形成,通常涉及数百名跨机构、跨学科的贡献者。这些努力凸显了开源作为一种机制的作用,用于协调那些仅通过传统学术或企业结构难以组织的大规模跨学科工作。

展望未来

开源 AI 生态系统正通过全球参与、技术专业化和机构采纳的结合而持续演进。以下几个趋势很可能将定义下一阶段的发展。

地理权力再平衡正在加速。西方组织越来越寻求中国模型的可商业部署替代方案,这为 OpenAI 的 GPT-OSS、AI2 的 OLMo 以及 Google 的 Gemma 等努力注入了紧迫性,以期从美国和欧洲开发者手中提供有竞争力的开源选项。这些努力能否匹敌通义千问(Qwen)和 DeepSeek 的采用势头,将成为 2026 年的一个决定性议题。

机器人和科学领域子社区的增长表明,开源 AI 正从语言和图像生成扩展到物理和实验领域。围绕文本和图像模型建立的基础设施、规范和协调机制,正在被调整适配以用于新的模态和用例。

对于研究人员、开发者、企业和政府而言,开源仍然是构建、评估和治理 AI 系统的基础层。随着智能体部署的增加,开源及其互操作性将成为智能体蓬勃发展的关键。过去一年的发展轨迹明确了一点:开源生态系统是 AI 开发、适配和部署大量实际工作发生的地方,并且它对更广泛 AI 领域的影响力持续增长。

感谢 Hugging Face 社区持续构建 AI 生态系统的基础 🤗


如果您想引用这篇博文,可以使用以下 BibTeX:

@misc{hf_state_of_os_spring26,
  author    = {Avijit Ghosh and Lucie-Aimée Kaffee and Yacine Jernite and Irene Solaiman},
  title     = {State of Open Source on Hugging Face: Spring 2026},
  booktitle = {Hugging Face Blog},
  year      = {2026},
  url       = {https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026},
}

来源:Hugging Face:Blog(RSS) · huggingface.co