Hugging Face 与 NVIDIA 合作推出 Training Cluster as a Service
Introducing Training Cluster as a Service - a new collaboration with NVIDIA
Hugging Face 在 GTC Paris 上与 NVIDIA 合作发布 Training Cluster as a Service,让全球研究机构可以按训练时长申请 GPU 集群。
原文给出入口、合作组件和三类研究机构的使用案例,读者可以判断它如何降低获取 GPU 集群的门槛。
今天在 GTC 巴黎,我们很高兴地宣布与 NVIDIA 合作推出 Training Cluster as a Service,让世界各地的研究机构更容易使用大型 GPU 集群,从而为各个领域训练未来的基础模型。
让 GPU 集群触手可及
许多千兆瓦级 GPU 超级集群项目正在建设中,用于训练下一代 AI 模型。这似乎让“GPU 贫乏”与“GPU 富裕”之间的算力差距迅速扩大。但 GPU 就在那里,超大规模云厂商、区域云提供商和 AI 原生云提供商都在迅速扩大其容量。
那么,我们如何将 AI 算力与需要它的研究人员连接起来?我们如何让世界各地的大学、国家研究实验室和公司能够构建自己的模型?
这正是 Hugging Face 和 NVIDIA 通过 Training Cluster as a Service 所解决的问题——提供 GPU 集群可访问性,并具有仅按训练运行时长付费的灵活性。
要开始使用,Hugging Face 上的 250,000 个组织中的任何一个都可以在需要时请求所需的 GPU 集群规模。
工作原理
要开始使用,您可以代表您的组织在 hf.co/training-cluster 请求 GPU 集群
Training Cluster as a Service 将 NVIDIA 和 Hugging Face 的关键组件集成到一个完整的解决方案中:
- NVIDIA 云合作伙伴在区域数据中心为最新的 NVIDIA 加速计算(如 NVIDIA Hopper 和 NVIDIA GB200)提供容量,所有这些都集中在 NVIDIA DGX Cloud 中
- NVIDIA DGX Cloud Lepton——今天在 GTC 巴黎宣布——为研究人员提供对已配置基础设施的便捷访问,并支持训练运行调度和监控
- Hugging Face 开发者资源和开源库让训练运行轻松启动。
一旦您的 GPU 集群请求被接受,Hugging Face 和 NVIDIA 将根据您的规模、区域和时长要求,合作进行采购、定价、配置和设置您的 GPU 集群。
集群实践
与 TIGEM 共同推进罕见遗传病研究
Telethon 基因组与医学研究所——简称 TIGEM——是一个致力于理解罕见遗传病分子机制并开发新疗法的研究中心。训练新的 AI 模型是预测致病变异效应和药物重定位的新途径。
AI 为研究罕见遗传病的病因和开发治疗方法提供了新途径,但我们的领域需要训练新模型。Training Cluster as a Service 让我们能够在合适的时间轻松获取所需的 GPU 容量
-- Diego di Bernardo,TIGEM 基因组医学项目协调员
与 Numina 共同推进数学 AI
Numina 是一个非营利组织,致力于构建用于数学推理的开源、开放数据集 AI——并赢得了 2024 年 AIMO 进步奖。
我们正在顺利实现构建最佳闭源模型(如 Deepmind 的 AlphaProof)的开源替代方案的目标。计算资源是我们当前的瓶颈——通过 Training Cluster as a Service,我们将能够实现我们的目标!
-- Yann Fleureau,Project Numina 联合创始人
与 Mirror Physics 共同推进材料科学
Mirror Physics 是一家为化学和材料科学打造前沿 AI 系统的初创公司。
与 MACE 团队一起,我们正致力于推动 AI 在化学领域的极限。通过 Training Cluster as a Service,我们正在以前所未有的规模生成高保真化学模型。这将是该领域向前迈出的重要一步。
—— Sam Walton Norwood,Mirror 首席执行官兼创始人
为 AI 研究的多样性提供动力
Training Cluster as a Service 是 Hugging Face 与 NVIDIA 的一项新合作,旨在让全球 AI 研究者社区更容易获得 AI 算力。
获取大规模、高性能算力对于构建各个领域和语言的新一代 AI 模型至关重要。Training Cluster as a Service 将为研究人员和公司消除障碍,释放训练最先进模型的能力,并拓展 AI 可能性的边界。
—— Clément Delangue,Hugging Face 联合创始人兼首席执行官
将 DGX Cloud Lepton 与 Hugging Face 的 Training Cluster as a Service 集成,为开发者和研究人员提供了一种无缝的方式,可在广泛的云提供商网络中访问高性能 NVIDIA GPU。这一合作使 AI 研究人员和组织能够更轻松地扩展其 AI 训练工作负载,同时使用 Hugging Face 上熟悉的工具。
—— Alexis Bjorlin,NVIDIA DGX Cloud 副总裁
以 NVIDIA 赋能 AI 构建者
我们很高兴与 NVIDIA 合作,为 Hugging Face 组织提供 Training Cluster as a Service——你今天就可以在 hf.co/training-cluster 开始使用
今天在 GTC Paris 上,NVIDIA 宣布了许多面向 Hugging Face 用户的新贡献,从智能体到机器人!
- NVIDIA DGX Cloud Lepton 将欧洲开发者连接到全球 NVIDIA 算力生态系统
- NVIDIA AI 客户现在可以通过 NIM 部署超过 10 万个 Hugging Face 模型
- Hugging Face 用户可以使用 NVIDIA Cosmos Predict-2 构建自定义 Physical AI 模型
- NVIDIA Isaac GR00T N1.5 登陆 Hugging Face,为人形机器人提供动力
来源:Hugging Face:Blog · huggingface.co