德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先
German AI consortium releases Soofi S, an open 30B model that tops benchmarks in both English and German
德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。在HumanEval上得分73.8%,MBPP得分70.2,德语版MBPP得分84.2。上下文窗口支持最高100万token,在4万token长度下,生成吞吐量约为同规模稠密模型的8倍。模型权重已开源。
德国联盟用 Mamba-Transformer 混合架构做出一个 30B 开源模型,德语基准横扫,长上下文推理吞吐八倍于同级密集模型,想做德语 AI 的可以认真看了。

要点
- 一个德国研究联盟发布了开源语言模型 Soofi S,该模型完全在德国电信的 AI 云基础设施上训练完成。
- 该模型采用资源高效的混合架构,每个 token 仅激活其 316 亿参数中的 32 亿,即使输入非常长也能保持处理速度恒定。
- 凭借对德语训练数据的重点投入,Soofi S 在德语、英语和编程任务的基准测试中超越了其他完全开源的模型,如 Olmo 3 32B 和 Apertus 70B。
Soofi S 是首批完全在德国电信位于慕尼黑的 Industrial AI Cloud 上训练的大语言模型之一。这个开放的 30B 模型采用精简的混合架构,训练数据配比有意向德语倾斜。
由 KI Bundesverband(德国人工智能协会)协调的一个德国研究联盟发布了 Soofi S 30B-A3B,这是一个开放语言模型,根据其预训练报告,它在英语和德语基准测试中取得了完全开放模型中的最高分,超越了此前的领先者,如 OLMo 3 32B 和 Apertus 70B。

为长上下文打造的轻量架构
Soofi S 是一个混合专家模型。它总共有 316 亿参数,但每生成一个 token 仅激活约 32 亿参数。这使其计算成本更接近一个 3B 模型,而非传统的 30B 模型。该联盟原封不动地采用了 Nvidia 的 Nemotron 3 Nano 架构,这是一种将 Mamba-2 层与标准注意力层相结合的混合设计。
与典型 Transformer 的关键区别在于内存行为。在传统模型中,用于存储先前 token 以供注意力计算的 KV cache 会随上下文长度线性增长。在长输入和大量并行请求的情况下,重新加载该缓存会成为瓶颈。而 Soofi S 的 52 层中只有 6 层维护这样的缓存。
实际收益体现在生成吞吐量上。在上下文长度为 40,000 token、32 个并行请求的情况下,Soofi S 每 GPU 每秒生成的 token 数量大约是 140 亿至 240 亿参数区间稠密模型的八倍。随着上下文增长,传统模型的吞吐量会显著下降,而 Soofi S 从 4,000 到 256,000 token 几乎保持平稳。在测量中唯一表现出类似行为的模型是 阿里巴巴的 Qwen3.5 35B-A3B,它同样采用了混合架构。
围绕德语构建的训练数据组合
该联盟总共处理了约 27 万亿 token,分为三个阶段。在第一阶段,模型从约 20 万亿 token 中学习语言基础知识,这些 token 取自网络、代码、数学和特定领域文本的广泛混合。第二阶段随后使用约 6 万亿 token,来自更高质量的来源,旨在强化此前学到的模式。之后一个更短的第三阶段通过在长达一百万个 token 的超长文档上训练来扩展上下文窗口。

对德语的刻意侧重是核心所在。在第一阶段,德语占训练混合的 7.2%;在第二阶段,这一比例升至 15.3%。在 Nvidia 的 Nemotron 参考配方中,所有非英语语言加起来仅占约 5%。
在数据来源方面,该联盟结合了来自 HPLT 的德语网络文本、开放许可的 German Commons 语料库、FinePDFs 和 FineWiki 的德语部分,以及商业许可的 Genios 语料库——其中包含来自 916 家德国出版物的 1.93 亿篇报纸文章。机器翻译和合成生成的德语文本则补全了这一混合。
德语和英语开放模型最高分
根据报告,在与另外 16 个开放模型的评测对比中,Soofi S 在德语和英语的综合得分上领先所有完全开放模型。这其中包括 Allen Institute for AI 的 OLMo 3 32B,以及 ETH Zurich 和 EPFL 的 Apertus 70B。面对每一个欧洲主权基线,该模型在该套件中的所有德语基准测试中均处于领先,有时领先幅度达到两位数。

在代码基准测试中,Soofi S 在 HumanEval 上得分 73.8%,在 MBPP 上得分 70.2,在德语 MBPP 变体上得分 84.2,是开源同类模型中最好的成绩。在针对德国特定区域知识的测试 INCLUDE-DE 上,Soofi S 以 61.2 分与规模更大的 Qwen3.5 35B-A3B 并列第一。与 Nemotron 基线相比,德语数据配方将语言能力提高了 15.1 分,将科学测试 GPQA-Diamond 提高了 9.6 分,且未牺牲英语性能。

Soofi S 在德语竞赛数学方面表现不佳,在 Minerva MATH-DE 上得分 56 分,远远落后于 Qwen3.5 35B-A3B(76.5)和 Gemma 3 27B(65.6)。它在 NaturalQuestions 的开放事实检索上也落后。后者可能与它仅有 30 亿活跃参数有关,相比稠密的 27B 模型,其能存储的世界知识更少。

RULER 长上下文测试还揭示了一个具体的弱点:当模型需要从长文本中提取高频出现的词时,Soofi S 在上下文超过 32,000 tokens 后命中率降至约 3%,而可比的 Nemotron 模型仍能达到 60% 至 64%。作者将这一现象归因于其长上下文训练数据包含许多长文档,但缺乏专为提取任务设计的合成数据。在其余十二项 RULER 任务上,两个模型的表现大致相同。
主权基础设施与有据可查的开放性
此次训练于 3 月至 5 月间进行,在慕尼黑 Deutsche Telekom 的 Industrial AI Cloud 中最多使用 512 块 Nvidia B200 GPU,总计约 253,000 GPU-hours。根据该报告,该设施完全使用可再生能源运行,采用来自 Eisbach 运河的水进行冷却,并将余热输送到周边的 Tucherpark 社区。Soofi S 是该基础设施上首批大型训练运行之一。
Soofi 的背后是一个由德国研究机构和企业组成的联盟,由德国人工智能协会协调,并作为欧洲 IPCEI-CIS 计划的一部分,由德国联邦经济事务和能源部资助。
参与方包括弗劳恩霍夫 IAIS 和 IIS 研究所、德国人工智能研究中心(DFKI)、达姆施塔特工业大学、维尔茨堡大学、L3S 研究中心、柏林应用科技大学,以及 AI 公司 Ellamind 和 Merantix Momentum。该项目旨在构建一个开放的欧洲 AI 模型家族,能够运行在主权基础设施之上,并可在工业应用中进行测试。
研究人员将发布模型权重以及选定的中间检查点、完整的训练与评估代码,以及一份详细的数据清单,列出原始 token 数量、epoch 数和各来源的有效贡献。经过审查但被排除的来源也有记录。据团队称,这意味着 Soofi S 符合开源促进会的开源 AI 定义 1.0。
一项更严格的欧洲开放数据定义提案要求每一个训练 token 都必须可自由分发,但由于 Genios 数据占 1.3% 且带有商业许可,该提案未能满足。报告称,训练数据组合中约 99% 可以独立重建。该模型发布的确切许可证尚未最终确定。
正如第一作者Michael Fromm所写,Soofi S 将自身定位在 EuroLLM 或 Teuken 这类覆盖多种语言、旨在实现欧洲广泛多语言主权的项目,与性能最强的国际开放权重模型之间。据该项目网站介绍,该联盟正在为下一阶段寻找行业合作伙伴,以在涉及技术文档、代码生成和基于智能体的系统的应用中测试该模型。
来源:The Decoder:AI News(RSS) · the-decoder.com