Sentence Transformers 从达姆施塔特 UKP 实验室移交 Hugging Face 维护
Sentence Transformers is joining Hugging Face!
Hugging Face 宣布 Sentence Transformers 从 TU Darmstadt 的 UKP 实验室正式移交给 Hugging Face 维护。
官方宣布 Sentence Transformers 移交 Hugging Face 维护,读者可以了解后续开源许可、维护人和基础设施会有哪些变化。
今天,我们宣布 Sentence Transformers 将从 Iryna Gurevych 在 TU Darmstadt 的 Ubiquitous Knowledge Processing (UKP) Lab 迁移至 Hugging Face。Hugging Face 的 Tom Aarsen 自 2023 年底以来一直在维护该库,并将继续领导该项目。在新家,Sentence Transformers 将受益于 Hugging Face 强大的基础设施,包括持续集成和测试,确保其与信息检索和自然语言处理的最新进展保持同步。
Sentence Transformers(又称 SentenceBERT 或 SBERT)是一个流行的开源库,用于生成捕捉语义含义的高质量嵌入。自 2019 年由 Nils Reimers 创立以来,Sentence Transformers 已被研究人员和从业者广泛采用,用于各种自然语言处理(NLP)任务,包括语义搜索、语义文本相似度、聚类和释义挖掘。经过社区多年的开发和训练,超过 16,000 个 Sentence Transformers 模型已在 Hugging Face Hub 上公开可用,每月服务超过一百万独立用户。
“Sentence Transformers 是一个巨大的成功故事,也是我们整个实验室在计算语义相似度方面长期研究的结晶。Nils Reimers 做出了非常及时的发现,不仅产生了杰出的研究成果,还打造了一个高度可用的工具。这持续影响着自然语言处理和人工智能领域的几代学生和从业者。我还要感谢所有用户,尤其是贡献者,没有他们,这个项目不会有今天的成就。最后,我要感谢 Tom 和 Hugging Face 将项目带向未来。”
- Prof. Dr. Iryna Gurevych,TU Darmstadt Ubiquitous Knowledge Processing Lab 主任
“我们非常激动地正式欢迎 Sentence Transformers 加入 Hugging Face 大家庭!在过去两年里,看到这个项目在全球范围内获得大规模采用,这令人惊叹,这要归功于 UKP Lab 奠定的坚实基础以及围绕它的出色社区。这仅仅是开始:我们将继续加倍支持其成长和创新,同时忠于最初让它蓬勃发展的开放、协作精神。”
- Clem Delangue,Hugging Face 联合创始人兼 CEO
Sentence Transformers 将保持社区驱动、开源项目,并沿用之前的开源许可证(Apache 2.0)。欢迎并鼓励研究人员、开发者和爱好者做出贡献。该项目将继续优先考虑透明度、协作和广泛可及性。
项目历史
Sentence Transformers 库由 Nils Reimers 博士于 2019 年在达姆施塔特工业大学的泛在知识处理(UKP)实验室推出,由 Iryna Gurevych 教授指导。受标准 BERT 嵌入在句子级语义任务中的局限性的启发,Sentence-BERT 采用孪生网络架构来生成语义上有意义的句子嵌入,从而可以通过余弦相似度进行高效比较。得益于其模块化、开源的设计以及在语义文本相似度、聚类和信息检索等任务上的强大实证表现,该库迅速成为 NLP 研究工具包中的常备工具,催生了一系列后续工作以及依赖高质量句子表示的实际应用。
2020 年,该库增加了多语言支持,将句子嵌入扩展到超过 400 种语言。2021 年,在 Nandan Thakur 和 Johannes Daxenberger 博士的贡献下,该库扩展为支持使用 Cross Encoder 和 Sentence Transformer 模型进行成对句子评分。Sentence Transformers 还与 Hugging Face Hub 集成(v2.0)。四年多来,UKP 实验室团队将该库作为社区驱动的开源项目进行维护,并持续提供研究驱动的创新。在此期间,该项目的发展得到了德国研究基金会(DFG)、德国联邦教育与研究部(BMBF)以及黑森州高等教育、研究与艺术部(HMWK)对 Gurevych 教授的资助支持。
2023 年底,来自 Hugging Face 的 Tom Aarsen 接管了该库的维护工作,引入了 Sentence Transformer 模型的现代化训练(v3.0),并改进了 Cross Encoder(v4.0)和 Sparse Encoder(v5.0)模型。
致谢
达姆施塔特工业大学的泛在知识处理(UKP)实验室由 Iryna Gurevych 教授领导,在自然语言处理(NLP)和机器学习领域的研究享誉国际。该实验室在表示学习、大型语言模型和信息检索方面有着长期的开拓性工作记录,在顶级会议和期刊上发表了大量论文。除 Sentence Transformers 之外,UKP 实验室还开发了许多广泛使用的数据集、基准测试和开源工具,为学术研究和实际应用提供支持。
Hugging Face 谨向 UKP 实验室以及所有过去和现在的贡献者,特别是 Nils Reimers 博士和 Iryna Gurevych 教授,表示感谢,感谢他们对项目的奉献,以及将项目的维护和现在的管理托付给我们。我们还要感谢研究、开发者和从业者社区,他们通过模型贡献、错误报告、功能请求、文档改进和实际应用,为该库的成功做出了贡献。我们很高兴能在 UKP 实验室奠定的坚实基础上继续发展,并与社区合作,进一步推进 Sentence Transformers 的能力。
快速开始
对于刚接触 Sentence Transformers 或希望探索其功能的人:
- 文档:https://sbert.net
- GitHub 仓库:https://github.com/huggingface/sentence-transformers
- Hugging Face Hub 上的模型:https://huggingface.co/models?library=sentence-transformers
- 快速入门教程:https://sbert.net/docs/quickstart.html
近期 Sentence Transformers 博客文章
自 Sentence Transformers 由 Hugging Face 维护以来的最重要更新,按时间顺序排列:
- 使用 Sentence Transformers 训练和微调嵌入模型:面向稠密嵌入模型的现代训练 API。
- 使用 Sentence Transformers 训练和微调重排序模型:面向 Cross Encoder(重排序器)模型的等效训练 API。
- 使用 Sentence Transformers 训练和微调稀疏嵌入模型:面向稀疏编码器(SPLADE)模型的等效训练 API。
- 使用 Sentence Transformers 的多模态嵌入与重排序模型:通过同一 API 增加对文本、图像、音频和视频模型的支持。
- 使用 Sentence Transformers 训练和微调多模态嵌入与重排序模型:多模态推理文章的配套训练篇。
相关技术专题文章:
- 🪆 Matryoshka 嵌入模型简介:可截断的嵌入。
- 使用 Sentence Transformers 训练速度提升 400 倍的静态嵌入模型:无需注意力机制、对 CPU 友好的模型。
- 用于显著更快、更便宜检索的二进制和标量嵌入量化:嵌入向量的训练后压缩。
来源:Hugging Face:Blog · huggingface.co