德国AI联盟发布Soofi S,一款在英语和德语基准测试中均名列前茅的开源300亿参数模型

Reddit r/LocalLLaMA 模型

摘要

德国AI联盟发布Soofi S,一款开源的300亿参数混合专家模型,在英语和德语基准测试中取得最高分,采用混合Mamba-Transformer架构实现高效长上下文推理。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/15 17:55

# 德国AI联盟发布Soofi S,一款在英语和德语基准测试中均领先的开源300亿参数模型 来源:https://the-decoder.com/german-ai-consortium-releases-soofi-s-an-open-30b-model-that-tops-benchmarks-in-both-english-and-german/ **2026年7月15日更新:** 发布后,批评者认为Soofi S按照经典的Chinchilla扩展定律(https://the-decoder.com/deepmind-artificial-intelligence-is-far-from-being-fed-up/)标准属于严重“过度训练”。Google DeepMind于2022年发布这些定律,描述了在固定算力预算下如何平衡模型大小和训练数据。他们确定的最佳比例大约是每个参数20个token。Soofi S远远超过了这个比例。以约27万亿个token和300亿参数计算,其比例达到几百比一。如果只考虑每个token激活的32亿参数,这个比例甚至跃升至数千比一。 该项目技术负责人之一Michael Fromm反驳了这种批评。他认为这些规则不能简单套用到专家混合(MoE)架构上。“有新研究表明,旧有的密集模型扩展定律不再适用于MoE架构,”Fromm说。原因归结于MoE模型的构建方式。单个专家从看到相同的文档中受益,因此在一个大型、高质量的数据集中重复数据的问题比在密集模型中要小。作为比较,Fromm指出英伟达曾在高达25万亿个token上训练自己的模型。 **2026年7月13日原文章:** **Soofi S 是首批完全在慕尼黑德国电信工业AI云上训练的大型语言模型之一。这款开源的300亿参数模型采用了精简的混合架构,并在训练数据混合中特意增加了德语权重。** 一个由德国AI联邦协会(KI Bundesverband)协调的德国研究联盟发布了 Soofi S 30B-A3B(https://www.soofi.info/soofi-s/),这是一款开源语言模型,根据其预训练报告(https://www.soofi.info/)显示,该模型在英语和德语基准测试中均取得了完全开源模型的最高分,超越了此前领先的 OLMo 3 32B(https://the-decoder.com/olmo-3-debuts-as-the-first-fully-open-thinking-model-with-step-by-step-logic-exposed-to-users/)和 Apertus 70B(https://the-decoder.com/swiss-ai-initiative-introduces-apertus-as-a-fully-open-language-model-focused-on-transparency-and-privacy/)。 两张比较Soofi S 30B-A3B与竞争模型的图表。左图:能力指数与在40K上下文下测得的解码速度(TPS/GPU)关系图。右图:解码速度与上下文长度(从4K到256K tokens)关系图。Soofi S在两个面板中均领先,并保持近乎恒定的吞吐率。 (https://the-decoder.com/wp-content/uploads/2026/07/soofi-s-02-serving-efficiency.jpg) 得益于其混合Mamba-Transformer架构,Soofi S即使在极长上下文中也能保持吞吐量,而像Apertus 70B和Qwen3 32B这样的密集模型则急剧下降。 | 图片: Soofi ## 专为长上下文设计的精简架构 Soofi S 是一个专家混合模型。它总共包含316亿个参数,但每个生成的token仅激活约32亿个。这使得其计算成本更接近30亿参数模型,而非传统的300亿参数模型。该联盟采用了英伟达 Nemotron 3 Nano(https://the-decoder.com/nvidias-nemotron-3-ultra-becomes-the-smartest-open-us-model-but-china-still-leads/)的架构,未经修改,这是一种结合了Mamba-2层和标准注意力层的混合设计。 与传统Transformer的关键区别在于内存行为。在传统模型中,用于存储先前token以进行注意力计算的KV缓存随上下文长度线性增长。当输入很长且并行请求很多时,重新加载该缓存成为瓶颈。在Soofi S的52层中,只有6层维护这样的缓存。 实际效果体现在生成吞吐量上。在40,000个token的上下文长度和32个并行请求的情况下,Soofi S每GPU每秒生成的token数大约是140亿至240亿参数范围内密集模型的八倍。随着上下文增长,传统模型的吞吐量显著下降,而Soofi S从4,000到256,000个token几乎保持平坦。在测量中表现出类似行为的唯一模型是阿里巴巴的 Qwen3.5 35B-A3B(https://the-decoder.com/alibabas-open-qwen-3-5-takes-aim-at-gpt-5-mini-and-claude-sonnet-4-5-at-a-fraction-of-the-cost/),它也使用了混合架构。 ## 围绕德语构建的训练数据混合 该联盟总共处理了约27万亿个token,分为三个阶段。在第一阶段,模型从大约20万亿个token中学习语言基础知识,这些token来自广泛的网络、代码、数学和领域特定文本混合。第二阶段大约有6万亿个来自更高质量的token,旨在强化早期学到的模式。第三阶段较短,通过训练长达一百万token的超长文档来扩展上下文窗口。 流程图展示了三个阶段的训练数据混合情况。七个类别,包括英语网页、代码、推理、数学和德语,从第一阶段(约23T tokens)经过第二阶段(约6T)到第三阶段(约188B),德语的占比从7.2%上升到15.3%。 (https://the-decoder.com/wp-content/uploads/2026/07/soofi-s-03-data-mixture.jpg) 在三个训练阶段中,数据混合向更高质量的来源和显著更大比例的德语数据倾斜。 | 图片: Soofi 对德语的刻意关注是核心。在第一阶段,德语占训练混合的7.2%;在第二阶段,这一比例上升到15.3%。在英伟达的Nemotron参考配方中,所有非英语语言合计仅占约5%。 在数据源方面,该联盟结合了来自HPLT的德语网页文本、开源许可的German Commons语料库、FinePDFs和FineWiki的德语部分,以及商业许可的Genios语料库(包含来自916家德语出版物的1.93亿篇报纸文章)。机器翻译和合成生成的德语文本补全了混合。 ## 德语和英语均取得开源模型最高分 根据报告,在对其他16个开源模型的评估中,Soofi S在德语和英语的综合得分上领先所有完全开源模型。这包括来自艾伦AI研究所的OLMo 3 32B以及来自苏黎世联邦理工学院和洛桑联邦理工学院的Apertus 70B。针对每一个欧洲主权基线模型,该模型在测试套件中的所有德语基准测试中均胜出,有时领先幅度达两位数百分比。 柱状图比较Soofi S 30B-A3B与Apertus 70B、Alia 40B、Olmo 3 32B和EuroLLM 22B在八个基准测试组的表现。Soofi S在每个类别中均排名第一,英语综合得分70.1,德语综合得分79.1。 (https://the-decoder.com/wp-content/uploads/2026/07/soofi-s-04-eval-open-source.jpg) 在完全开源模型中,Soofi S在每个类别中均拔得头筹,包括超越像Apertus 70B这样更大的模型。 | 图片: Soofi 在代码基准测试中,Soofi S在HumanEval上得分73.8%,在MBPP上得分70.2%,在德语MBPP变体上得分84.2%,均为开源同行中的最佳结果。在INCLUDE-DE(一项针对德国特定区域知识的测试)中,Soofi S与更大的Qwen3.5 35B-A3B以61.2分并列第一。与Nemotron基线相比,德语数据配方将语言能力提高了15.1分,科学测试GPQA-Diamond提高了9.6分,且未牺牲英语性能。 德语基准测试柱状图显示Soofi S 30B-A3B在包括GLP-DE(88.8)、ARC-Challenge-DE(92.3)和MBPP-DE(84.2)在内的七项测试中领先,超越了Apertus 70B、Alia 40B、Olmo 3 32B和EuroLLM 22B。 (https://the-decoder.com/wp-content/uploads/2026/07/soofi-s-05-german-capabilities.jpg) Soofi S在比较组中的每一项德语基准测试中均排名第一,有时领先幅度达两位数。 | 图片: Soofi Soofi S在德语竞赛数学方面表现不佳,在Minerva MATH-DE上得分56分,远落后于Qwen3.5 35B-A3B(76.5分)和Gemma 3 27B(65.6分)(https://the-decoder.com/google-releases-new-gemma-3-open-model-family/)。它也在NaturalQuestions的开放事实检索上落后。后者可能与其仅有30亿活跃参数有关,这比密集的270亿模型能存储的世界知识更少(https://the-decoder.com/sinas-open-model-vibethinker-3b-aims-to-show-reasoning-compresses-well-but-factual-knowledge-doesnt/)。 柱状图比较Soofi S 30B-A3B与Nemotron 3 Nano 30B-A3B、Qwen3.5 35B-A3B、Ministral 3 14B和Gemma 3 27B。Soofi S在代码EN、代码DE和GPQA-D-DE上领先,在其他方面与密集模型表现相当。 (https://the-decoder.com/wp-content/uploads/2026/07/soofi-s-06-eval-open-weight.jpg) 与更大的开放权重模型相比,Soofi S保持竞争力,并持续优于其架构相同的参考模型Nemotron 3 Nano。 | 图片: Soofi RULER长上下文测试也揭示了一个特定弱点:当模型需要从长文本中提取频繁出现的词汇时,Soofi S在上下文超过32,000个token后的命中率降至约3%,而可比的Nemotron模型仍能达到60%至64%。作者将此归因于他们的长上下文训练数据包含许多长文档,但缺乏为提取任务设计的合成数据。在其余12项RULER任务中,两个模型表现大致相同。 ## 主权基础设施与规范化开源 训练运行于3月至5月期间进行,使用了慕尼黑德国电信工业AI云(https://the-decoder.com/10000-nvidia-blackwell-gpus-set-to-increase-germanys-ai-capacity-by-50-percent/)上多达512块英伟达B200 GPU,总计约253,000 GPU小时。根据报告,该设施完全使用可再生能源,采用伊萨尔运河的水进行冷却,并将废热供给周围的Tucherpark社区。Soofi S是该基础设施上首批重大训练运行之一。 Soofi背后是由德国AI联邦协会协调、由德国联邦经济事务和能源部作为欧洲IPCEI-CIS项目一部分资助的德国研究机构和公司联盟。 参与者包括弗劳恩霍夫IAIS和IIS研究所、德国人工智能研究中心(DFKI)、达姆施塔特工业大学、维尔茨堡大学、L3S研究中心、柏林应用科学大学,以及AI公司Ellamind和Merantix Momentum。该项目的目标是构建一个可在主权基础设施上运行并用于工业应用测试的开源欧洲AI模型家族。 研究人员正在发布模型权重以及选定的中间检查点(https://huggingface.co/collections/Soofi-Project/soofi-s-beta-models)、完整的训练和评估代码,以及详细的数据清单,列出了每个来源的原始token数量、轮次和有效贡献。经过审查但被排除的来源也有记录。据团队称,这意味着Soofi S符合开源促进会(Open Source Initiative)的开放源代码AI定义1.0(https://the-decoder.com/open-source-initiative-releases-first-formal-definition-of-open-source-ai/)。 一个更严格的欧洲开放数据定义提案要求每个训练token都必须可自由分发,由于1.3%的Genios数据带有商业许可,Soofi S不符合这一提案。报告称,约99%的训练混合数据可以独立重建。模型发布的确切许可尚未最终确定。 正如技术负责人Michael Fromm所写(https://x.com/effi288/status/2075904321707798699),Soofi S定位于像EuroLLM或Teuken(https://the-decoder.com/eu-project-releases-7b-model-that-speaks-24-european-languages/)这样的多语言欧洲主权项目(覆盖多种语言)与性能最高的国际开放权重模型之间。根据项目网站,该联盟正在为下一阶段寻找行业合作伙伴,以在涉及技术文档、代码生成和基于智能体的系统的应用中测试该模型。

相似文章

一款面向德语和英语的主权、开源基础模型

arXiv cs.CL

Soofi S 30B-A3B是一款主权、开源的混合专家基础模型,专为德语和英语设计,预训练于27万亿个token。它在基准测试中与密集的14-27B模型表现相当,同时提供卓越的长上下文吞吐量,并优于所有欧洲开源基线模型。

Soofi – 主权开源基础模型

Hacker News Top

Soofi 推出了 Soofi S,这是一个拥有300亿参数的混合专家开源基础模型,在27万亿个token上训练,面向德语和英语的工业AI应用。该模型是欧洲主权AI计划的一部分。

一款面向德语和英语的主权开源基础模型

Hugging Face Daily Papers

SoofiS30B-A3B 是一款面向德语和英语的主权开源混合专家(MoE)Mamba Transformer 基础模型,每 token 仅激活 30B 参数中的 3B,并在基准测试中表现强劲。