跳到正文
北京时间
原文
Hugging Face:Blog·· 2022-07-12精选AI 评分78

Hugging Face 发布 1760 亿参数开源多语言大模型 BLOOM

Introducing The World's Largest Open Multilingual Language Model: BLOOM

AI 导读

Hugging Face 与 BigScience 发布 1760 亿参数的开源多语言大模型 BLOOM,支持 46 种自然语言和 13 种编程语言。模型由 70 多个国家、250 多个机构的 1000 多名研究者历时一年协作完成,在法国 Jean Zay 超算上训练 117 天,算力来自 CNRS 和 GENCI 价值约 300 万欧元的资助。

推荐理由

原文来自 BLOOM 团队官方发布,给出了参数规模、语言覆盖、训练成本和开放使用方式,读者可以了解这个开放大模型的实际边界。

正文 · AI 翻译

大型语言模型(LLM)对人工智能研究产生了重大影响。这些强大的通用模型可以根据用户的指令承担各种各样的新语言任务。然而,学术界、非营利组织和较小公司的研究实验室发现,创建、研究甚至使用 LLM 都很困难,因为只有少数拥有必要资源和独家权利的工业实验室才能完全访问它们。今天,我们发布了 BLOOM,这是第一个在完全透明的情况下训练的多语言 LLM,以改变这种现状——这是有史以来参与单个研究项目的人工智能研究人员最大规模合作的结果。

凭借其 1760 亿个参数,BLOOM 能够生成 46 种自然语言和 13 种编程语言的文本。对于几乎所有语言,例如西班牙语、法语和阿拉伯语,BLOOM 都将是有史以来第一个参数超过 1000 亿的语言模型。这是一年工作的成果,涉及来自 70 多个国家和 250 多个机构的 1000 多名研究人员,最终在法国巴黎南部的 Jean Zay 超级计算机上对 BLOOM 模型进行了为期 117 天(3 月 11 日至 7 月 6 日)的训练,这得益于法国研究机构 CNRS 和 GENCI 提供的价值约 300 万欧元的计算资助。

研究人员现在可以下载、运行和研究 BLOOM,以深入探究最近开发的大型语言模型的性能和行为,直至其最深的内部运作。更普遍地说,任何同意该模型负责任 AI 许可证(在 BigScience 项目期间开发)条款的个人或机构都可以在本地机器或云提供商上使用并基于该模型进行构建。本着这种合作和持续改进的精神,我们还首次发布了训练的中间检查点和优化器状态。没有 8 块 A100 可供使用?一个推理 API,目前由 Google 的 TPU 云和该模型的 FLAX 版本支持,也允许快速测试、原型设计和较小规模的使用。您已经可以在 Hugging Face Hub 上试用它。

这仅仅是开始。随着研讨会继续对该模型进行实验和修补,BLOOM 的能力将继续提高。我们已经开始努力使其像我们之前的 T0++ 一样可指令化,并计划增加更多语言,将模型压缩为性能水平相同的更可用版本,并将其用作更复杂架构的起点……研究人员和从业者一直想运行的所有实验,从 1000 多亿参数模型的能力开始,现在都成为可能。BLOOM 是一个我们打算培育的活模型家族的种子,而不仅仅是一个一次性的模型,我们已准备好支持社区扩展它的努力。

来源:Hugging Face:Blog · huggingface.co