德国AI联合体发布开源30B模型Soofi S,基准测试领先
![]()

核心要点
- 德国研究联盟发布开源大语言模型Soofi S,其训练全程依托Deutsche Telekom的AI云基础设施。
- 该模型采用资源高效的混合架构,每生成一个token仅激活316亿总参数中的32亿,即便处理超长输入,运算速度也能保持稳定。
- 因侧重德语训练数据,Soofi S在德语、英语及编程任务基准测试中,性能优于Olmo 3 32B、Apertus 70B等全开源模型。
更新说明
- 新增关于过度训练指控的声明
2026年7月15日更新:
模型发布后,有批评者依据经典的Chinchilla缩放定律,认为Soofi S存在严重的"过度训练"问题。该定律由Google DeepMind于2022年发布,阐述了固定算力预算下模型规模与训练数据的平衡方法,指出最优比例约为每参数对应20个token。而Soofi S远超这一比例:它以约27万亿token对应300亿参数,比例达数百比一;若按每token激活的32亿参数计算,比例更是攀升至数千比一。
项目技术负责人迈克尔·弗罗姆驳斥了这一批评。他认为,上述定律并不适用于"混合专家(MoE)"架构。弗罗姆表示:"最新研究表明,针对稠密模型制定的旧缩放定律,已不再适用于MoE架构。"原因在于MoE模型的构建方式:单个专家模块可从重复文档中获益,因此在大规模高质量数据集中,重复数据的影响远小于稠密模型。他还以Nvidia为例,指出该公司训练自有模型时所用token量高达25万亿。
2026年7月13日原文:
Soofi S是首批完全依托慕尼黑Deutsche Telekom工业AI云训练的大语言模型之一。这款开源300亿参数模型采用精简混合架构,训练数据刻意向德语倾斜。
由德国人工智能协会(KI Bundesverband)牵头的德国研究联盟,发布了Soofi S 30B-A3B开源语言模型。据其预训练报告显示,该模型在英语和德语基准测试中取得全开源模型最高分,超越了OLMo 3 32B、Apertus 70B等此前的领先模型。

适配超长上下文的精简架构
Soofi S是一款混合专家(MoE)模型,总参数达316亿,但每生成一个token仅激活约32亿参数,算力成本更接近传统30亿参数模型,而非300亿参数模型。该联盟未做任何修改,直接采用Nvidia Nemotron 3 Nano的混合架构,将Mamba-2层与标准注意力层相结合。
与典型Transformer模型的核心差异在于内存表现:传统模型中,存储注意力计算所需历史token的KV缓存会随上下文长度线性增长,处理超长输入和大量并行请求时,缓存重载会成为性能瓶颈。而Soofi S的52层中,仅有6层保留此类缓存。
这一设计的实际优势体现在生成吞吐量上:在4万token上下文、32路并行请求的场景下,Soofi S每GPU每秒生成的token量,约为140亿至240亿参数级稠密模型的8倍。传统模型的吞吐量会随上下文长度增加大幅下降,而Soofi S在4000至256000token范围内,吞吐量几乎保持平稳。测试中表现出类似特性的仅有阿里巴巴Qwen3.5 35B-A3B,该模型同样采用混合架构。
以德语为核心的训练数据配比
研究联盟总计处理约27万亿token,分三个阶段完成训练:第一阶段,模型从网页、代码、数学及专业领域文本等多元数据源中,学习约20万亿token的语言基础;第二阶段,用约6万亿token的高质量数据源,强化前期学习到的语言模式;第三阶段耗时较短,通过训练最长达100万token的超长文档,扩展模型的上下文窗口。

刻意侧重德语是训练的核心策略:第一阶段德语占训练数据的7.2%,第二阶段提升至15.3%。而在Nvidia Nemotron的参考方案中,所有非英语语言的总占比仅约5%。
数据源方面,研究联盟整合了多类德语文本:HPLT的德语网页文本、开源授权的German Commons语料库、FinePDFs和FineWiki中的德语内容,以及商业授权的Genios语料库(包含916家德国出版物的1.93亿篇新闻文章)。机器翻译及合成生成的德语文本则作为补充。
德语与英语基准测试均获开源模型最高分
报告显示,在与16款其他开源模型的对比评估中,Soofi S在德语和英语综合得分上均位列全开源模型第一,超越了艾伦人工智能研究院的OLMo 3 32B,以及苏黎世联邦理工学院与洛桑联邦理工学院联合开发的Apertus 70B。对比所有欧洲自主研发基准模型,Soofi S在所有德语基准测试中均领先,部分项目优势达两位数。

在代码基准测试中,Soofi S在HumanEval上得分73.8%,MBPP上得分70.2%,德语版MBPP上得分84.2%,均为开源模型中的最佳成绩。在德国特定区域知识测试INCLUDE-DE中,Soofi S以61.2分与更大规模的Qwen3.5 35B-A3B并列第一。与Nemotron基准模型相比,德语数据方案使模型的语言能力提升15.1分,科学测试GPQA-Diamond得分提升9.6分,且未牺牲英语性能。

Soofi S在德语竞赛数学测试中的表现相对逊色:Minerva MATH-DE仅得56分,远低于Qwen3.5 35B-A3B(76.5分)和Gemma 3 27B(65.6分)。在NaturalQuestions开放事实检索任务中也处于落后地位,这可能与仅激活30亿参数有关——此类模型存储的世界知识量少于270亿参数的稠密模型。

RULER长上下文测试还暴露了一个特定短板:当需要从长文本中提取高频词汇时,上下文长度超过32000token后,Soofi S的命中率降至约3%,而同类Nemotron模型仍能保持60%至64%的命中率。研究人员认为,这是因为长上下文训练数据虽包含大量超长文档,但缺少专为提取任务设计的合成数据。在RULER其余12项任务中,两款模型表现相近。
自主可控基础设施与透明化开源
训练于2026年3月至5月在慕尼黑Deutsche Telekom工业AI云完成,最多使用512张Nvidia B200 GPU,总计约25.3万GPU小时。报告显示,该设施完全采用可再生能源,依托艾斯巴赫运河水冷却,并将余热输送至周边的图赫公园社区。Soofi S是该基础设施承接的首批大规模训练任务之一。
Soofi项目由德国研究机构与企业组成的联盟推进,由德国人工智能协会协调,获德国联邦经济事务与能源部资助,属于欧洲IPCEI-CIS计划的一部分。
参与方包括弗劳恩霍夫IAIS与IIS研究所、德国人工智能研究中心(DFKI)、达姆施塔特工业大学、维尔茨堡大学、L3S研究中心、柏林应用科技大学,以及AI企业Ellamind和Merantix Momentum。项目目标是打造一个开源欧洲AI模型家族,可在自主可控基础设施上运行,并能在工业场景中测试应用。
研究团队公开了模型权重及部分中间检查点、完整训练与评估代码,以及一份详细的数据清单,列出了各数据源的原始token量、训练轮数及实际贡献占比,同时记录了经过审核但未纳入的数据源。据团队介绍,Soofi S符合开源促进会(Open Source Initiative)发布的《开源AI定义1.0》。
不过,该模型未满足欧洲更严格的开放数据定义要求——这一定义要求所有训练token均可自由分发,原因在于占比1.3%的Genios数据采用商业授权。报告指出,约99%的训练数据可独立复现。目前模型的最终授权方案尚未确定。
正如技术负责人迈克尔·弗罗姆所述,Soofi S定位介于覆盖多语言的泛欧自主项目(如EuroLLM或Teuken)与性能顶尖的国际开源权重模型之间。据项目官网信息,联盟正在寻找行业合作伙伴,推进下一阶段工作,在技术文档处理、代码生成、智能体系统等场景中测试该模型。