一款面向德语和英语的主权、开源基础模型

arXiv cs.CL 模型

摘要

Soofi S 30B-A3B是一款主权、开源的混合专家基础模型,专为德语和英语设计,预训练于27万亿个token。它在基准测试中与密集的14-27B模型表现相当,同时提供卓越的长上下文吞吐量,并优于所有欧洲开源基线模型。

arXiv:2607.09424v1 公告类型: 新 摘要: 我们推出 Soofi S 30B-A3B,一款主权、开源的混合专家(MoE)混合架构 Mamba Transformer 基础模型,适用于德语和英语。其混合设计每token仅激活30B参数中的3B,并在上下文增长时保持推理缓存接近恒定,从而在长上下文、高并发部署场景下相比密集模型具有决定性吞吐量优势。该模型在约27万亿个token上进行预训练,并刻意提高了德语数据的权重,在英语和德语综合基准测试中与密集的14B至27B模型表现相当,同时在17个开源基础模型中取得了两种语言的最佳代码聚合分数,并优于我们比较范围内的所有欧洲主权基线模型——包括那些活跃参数规模大得多的模型。在所有完全开放的模型中,Soofi S 取得了最高的英语和德语评估分数,领先于 Olmo 3 32B 和 Apertus 70B。Soofi S 在德国工业人工智能云上端到端构建,该云是由德国电信在慕尼黑运营的主权高性能计算规模人工智能基础设施。Soofi S 将以高度宽松的开放获取条款发布:权重、选定的中间检查点、完整的按来源数据核算、超参数、训练和评估代码。在源许可允许的情况下,数据构建工件将以宽松许可发布;商业许可来源则记录有汇总统计数据和精确的混合核算。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:58

# 1 引言 来源:https://arxiv.org/html/2607.09424 ![[无标题图片]](https://arxiv.org/html/2607.09424v1/images/logo.png) 一个主权、开源的德语和英语基础模型 Soofi S 预训练报告 v1.0 Soofi 团队* 核心团队:Benedikt Droste10, David Fitzek3,9, Ruben Härle5, Lukas Helff2,5, Maximilian Idahl10, Alex Jude3,9, Abbas Goher Khan3, Maurice Kraus5, Timm Ruland3,9, Richard Rutmann3,9, Sebastian Sztwiertnia5 贡献者:Markus Frey3,9, Daniil Gurgurov2, Jan Pfister6, Tom Röhr7, Sebastian von Rohrscheidt7 顾问:Jörg Bienert1, Nicolas Flores-Herr3, Simon Gottschalk8, Andreas Hotho6, Kristian Kersting2,5,11, Joachim Köhler3, Alexander Löser7, Wolfgang Nejdl8, Simon Ostermann2, Jan Plogsties4, Patrick Putzky12 技术负责人:Mehdi Ali3,9, Michael Fromm3,9, Max Lübbering3,9 所属机构:1KI Bundesverband,2DFKI,3Fraunhofer IAIS,4Fraunhofer IIS,5Technische Universität Darmstadt,6Universität Würzburg,7Berliner Hochschule für Technik,8L3S Research Center,9Lamarr,10ellamind,11hessian.AI,12Merantix Momentum 协调与资助:由 KI Bundesverband 协调的联盟。由德国联邦经济与能源部 (BMWE) 资助。 ∗*作者按字母顺序排列。详细贡献见附录A (https://arxiv.org/html/2607.09424#A1)。 1 摘要 我们介绍了 Soofi S 30B-A3B,这是一个主权、开源的混合专家(MoE)混合 Mamba Transformer 基础模型,专为德语和英语设计。其混合设计每 token 仅激活 30B 参数中的 3B,并在上下文增长时保持推理缓存近乎恒定,这使得它在长上下文、高并发部署中相比密集模型具有决定性的吞吐量优势。该模型在约 27 万亿 token 上进行了预训练,并有意提高了德语权重。Soofi S 在英语和德语综合基准测试中与 14 到 27B 参数的密集模型相当,同时在 17 个开放基础模型中获得了两种语言的最佳代码聚合分数,并且在我们比较中优于所有欧洲主权基线模型,包括那些活跃参数更多的模型。在完全开放的模型中,Soofi S 获得了最高的英语和德语评估分数,领先于 Olmo 3 32B 和 Apertus 70B。Soofi S 在德国工业人工智能云上端到端构建,这是一个由德国电信在慕尼黑运营的主权 HPC 级 AI 基础设施。Soofi S 将以高度宽松的开放获取条款发布:权重、选定的中间检查点111https://huggingface.co/Soofi-Project、完整的按源数据核算、超参数以及训练和评估代码。在源许可证允许的情况下,数据构建工件以宽松许可证发布;商业许可的来源则记录聚合统计数据和精确的混合核算。 参见标题(a)能力与测量的聚合解码 TPS。参见标题(b)随上下文变化的聚合解码 TPS 缩放。 图 1:长上下文服务效率。Soofi S 将前沿水平的能力与测量的最高聚合长上下文解码 TPS 相结合,并且与完全注意力密集基线不同,它能在上下文增长时保持高吞吐量。面板 (1(a) (https://arxiv.org/html/2607.09424#S1.F1.sf1)) 绘制了能力指数与在 40K 上下文和批次大小 32 下测量的聚合解码 TPS/GPU 的关系图。能力指数平均了五个基准组,即代码、GSM8K、GPQA-Diamond、英语综合和德语综合,在将每个组归一化到最佳绘图模型之后。聚合解码 TPS/GPU 使用 TP=1、单 B200 vLLM 延迟扣除协议测量。面板 (1(b) (https://arxiv.org/html/2607.09424#S1.F1.sf2)) 显示了在相同批次大小 32 协议下,测量的聚合解码 TPS/GPU 作为输入上下文长度的函数。两个面板都是越高越好。

开放语言模型以惊人的速度改进,但对于任何决定实际部署什么的人来说,仍有三个明显的差距。第一个是实质而非名义上的开放性:尽管出现了大量有能力的模型,但大多数发布仍然是仅权重发布,仅用聚合 token 计数记录其训练,并省略了重现或审计它们所需的数据、配方和决策。第二个是语言:通用多语言模型要么以英语为中心,要么将其容量稀疏地分布在数十种语言中,使得德语相对于其经济和科学权重而言代表性不足。迄今为止,专门的欧洲努力[3 (https://arxiv.org/html/2607.09424#bib.bib3),26 (https://arxiv.org/html/2607.09424#bib.bib26),53 (https://arxiv.org/html/2607.09424#bib.bib53),5 (https://arxiv.org/html/2607.09424#bib.bib5)]优先考虑了开放性和语言覆盖范围,而不是前沿能力。第三个差距是最直接影响部署成本的那个,也是我们选择的架构所针对的。在经济并发性下,生成的价格不是由模型名义上包含多少参数决定的,甚至不是由它每 token 激活多少参数决定的,而是由内存带宽决定的:每个解码的 token 都必须重新读取模型权重,对于 Transformer,还需要重新读取批次中每个序列的注意力缓存。随着上下文增长到数万或数十万个 token,并且许多请求并行服务,这个键值(KV)缓存开始占据主导地位,完全注意力密集模型会相应变慢。因此,一个保持其每个序列状态小而上下文长度近乎恒定的模型,在长上下文、高并发(这正是生产中最重要的场景)中享有结构性优势,并且这种优势会不断累积。 Soofi S 30B-A3B 同时解决了这三个问题:它是一个混合专家(MoE)混合 Mamba Transformer[61 (https://arxiv.org/html/2607.09424#bib.bib61),60 (https://arxiv.org/html/2607.09424#bib.bib60)],经过训练在德语和英语中都表现出色,并将以彻底开放的方式发布:不仅是权重,还包括审计训练每个阶段所需的全部工件,并在源许可证允许的情况下,重建数据混合,这符合最近完全开放努力的精神[5 (https://arxiv.org/html/2607.09424#bib.bib5),64 (https://arxiv.org/html/2607.09424#bib.bib64)]。在架构上,它采用了公开的 Nemotron 3 Nano 参考设计[61 (https://arxiv.org/html/2607.09424#bib.bib61)](图 2 (https://arxiv.org/html/2607.09424#S2.F2)):Mamba-2 层[16 (https://arxiv.org/html/2607.09424#bib.bib16)]使用固定大小的循环状态执行大部分序列混合,其 52 层中只有 6 层维护 KV 缓存,稀疏 MoE 层每 token 仅激活 316 亿参数中的 32 亿——相当于一个 30B 网络的容量,但推理成本大致相当于一个 3B 网络。 ##### 贡献。我们总结如下:

- •德语-英语冠军。Soofi S 在英语和德语基础模型综合基准测试中实现了同类最佳性能,包括在代码、数学和德语区域知识方面的强大表现。它是我们评估中在英语和德语基准测试中最强大的完全开放模型,并且在我们比较中,在我们的套件中的每个德语基准测试上都匹配或优于所有欧洲主权基线,同时在英语和德语综合性能上匹配密集的 14-27B 国际模型,而活跃参数成本仅为其一小部分(第 4 节 (https://arxiv.org/html/2607.09424#S4))。
- •完全的数据透明性。我们发布了完整的预训练语料库统计信息(LABEL:tab:phase1-sources,LABEL:tab:phase2-sources,表 10 (https://arxiv.org/html/2607.09424#A2.T10))和可重现的构建脚本222https://github.com/soofi-project/Soofi-Pretraining,包括按源和按语言的 token 核算,区分数据集卡片估计与 tokenizer 精确的已消耗 token 计数。我们还提供了德语:英语:代码的混合比例及其背后的理由,这与仅披露聚合 token 计数的报告形成对比。
- •可重现的配方。我们发布了完整的学习率调度(Warmup–Stable–Decay)、优化器、所有超参数、每个阶段的 token 预算以及阶段边界,以便第三方可以重建运行。
- •长上下文服务效率。混合 Mamba–MoE 设计使得每个序列的缓存随上下文长度近乎恒定,在 40K 上下文和批次大小 32 下,测量的聚合解码 TPS/GPU 是密集 14-24B 模型的 8-9 倍,并且聚合解码 TPS 在 4K 到 256K 范围内基本保持平坦,而完全注意力模型则会退化(图 1 (https://arxiv.org/html/2607.09424#S1.F1),第 4.3 节 (https://arxiv.org/html/2607.09424#S4.SS3))。
- •有记录的设计。我们报告了每个选择背后的数据和设计消融,揭示了*为什么*,而不仅仅是最终配置。
- •
本报告的其余部分记录了 Soofi S 30B-A3B Base 的端到端过程。图 2 (https://arxiv.org/html/2607.09424#S2.F2) 介绍了模型和训练配方:我们采用的 Nemotron 3 Nano 参考架构及其采用理由、Warmup–Stable–Decay 优化调度、所有超参数和每个阶段的 token 预算、运行的训练动态以及计算基础设施。第 3 节 (https://arxiv.org/html/2607.09424#S3) 详细介绍了三个阶段、26.68T token 的德语-英语数据课程,包含每个阶段的完整按源 token 核算。然后,第 4 节 (https://arxiv.org/html/2607.09424#S4) 根据两个轴评估了由此产生的基础模型与 16 个具有可比或更大活跃大小的开放模型:跨并行英语和德语基准测试的能力,以及服务效率。第 5 节 (https://arxiv.org/html/2607.09424#S5) 将这项工作置于先前开放和欧洲努力的背景下,第 6 节 (https://arxiv.org/html/2607.09424#S6) 得出结论。

## 2 模型架构和训练
参见标题图 2:在完整 ∼27T token 运行中的训练动态。该数量根据消耗的 token 数(以万亿计)绘制;预训练到退火的转变发生在 ∼20T token 处。实线是 1,000 步的滚动中位数,淡迹是原始的每步信号。

Soofi S 30B-A3B Base 采用了 Nemotron 3 Nano[61 (https://arxiv.org/html/2607.09424#bib.bib61),60 (https://arxiv.org/html/2607.09424#bib.bib60)] 的混合 Mamba–Transformer 混合专家(MoE)参考架构:一个 52 层网络,交错使用 23 个 Mamba-2 序列混合层[16 (https://arxiv.org/html/2607.09424#bib.bib16)]、23 个具有共享专家的细粒度 MoE 层[77 (https://arxiv.org/html/2607.09424#bib.bib77),19 (https://arxiv.org/html/2607.09424#bib.bib19),15 (https://arxiv.org/html/2607.09424#bib.bib15),41 (https://arxiv.org/html/2607.09424#bib.bib41)],以及 6 个分组的查询注意力(GQA)层[1 (https://arxiv.org/html/2607.09424#bib.bib1)],稀疏地分布在网络深度中。该模型总计约 316 亿参数,其中每次前向传播仅激活约 32 亿参数(包括嵌入约 36 亿),并且只有 6 个 GQA 层维护 KV 缓存。由于我们无需修改即可重用参考设计,我们请读者参考 Nemotron 报告[60 (https://arxiv.org/html/2607.09424#bib.bib60),61 (https://arxiv.org/html/2607.09424#bib.bib61)]以了解设计动机和每个架构选择背后的消融;表 1 (https://arxiv.org/html/2607.09424#S2.T1) 记录了确切配置以确保可重复性。

##### 为何采用参考架构。重用已建立、公开指定的架构而不是设计定制的架构是一个刻意的决定,基于三个理由。首先,*可部署性*:Nemotron 3 Nano 架构已集成到主要的开放推理和服务栈中,包括用于我们自己服务测量的 vLLM 栈(第 4.3 节 (https://arxiv.org/html/2607.09424#S4.SS3)),其 Mamba-2、GQA 和 MoE 组件拥有成熟、高度优化的内核,因此 Soofi S 可以在发布之日由现有软件高效托管,无需下游用户进行定制集成工作。其次,*服务效率*:主要由 Mamba-2 组成的骨干网使得该架构在我们目标的确切场景中异常快速,预填充和解码成本随序列长度近乎线性增长,每个序列的缓存保持近乎恒定,这正是第 4.3 节 (https://arxiv.org/html/2607.09424#S4.SS3) 中长上下文吞吐量结果的基础,并使得第 3.4 节 (https://arxiv.org/html/2607.09424#S3.SS4) 中的 100 万 token 上下文扩展变得可行。第三,*科学控制*:与 Nemotron 3 Nano 共享骨干网使得该模型成为一个架构相同的基线,因此我们的德语-英语数据配方的效果可以单独衡量(第 4.2 节 (https://arxiv.org/html/2607.09424#S4.SS2))。

表 1:Soofi S 30B-A3B 架构,遵循 Nemotron 3 Nano 参考配置[61 (https://arxiv.org/html/2607.09424#bib.bib61)]。层模式交错使用 Mamba-2 和 MoE 层,网络中分布有 6 个 GQA 层。

### 2.1 优化和超参数
我们使用 Megatron-Bridge 框架777对于此训练运行,我们采用了 Megatron-Bridge (https://github.com/NVIDIA/Megatron-Bridge),而不是将 Nemotron-3 参考架构集成到我们开源栈中[50 (https://arxiv.org/html/2607.09424#bib.bib50)],因为 Megatron-Bridge 已经为新发布的架构提供了成熟、可靠的支持。结合 AdamW[49 (https://arxiv.org/html/2607.09424#bib.bib49)],使用 Warmup–Stable–Decay (WSD)[35 (https://arxiv.org/html/2607.09424#bib.bib35),30 (https://arxiv.org/html/2607.09424#bib.bib30)] 学习率调度,其衰减段采用 minus_sqrt 形状。除了长上下文阶段(第 2.2 节 (https://arxiv.org/html/2607.09424#S2.SS2))之外,所有阶段共享相同的并行化和批处理配置:张量模型并行(TP)大小为 11,专家并行(EP)大小为 8,序列并行化禁用,微批次大小为 22,全局批次大小为 3072,序列长度为 8192 个 token,其余 GPU 用于数据并行化和分布式(优化器状态分片)优化器。这相当于每个优化器步处理 25,165,824 个 token。所有阶段均以 bf16 混合精度训练。由于细粒度 MoE 层将每个 token 路由到不同专家并行秩上持有的专家,全对全通信位于关键路径上,这促使了第 2.4 节 (https://arxiv.org/html/2607.09424#S2.SS4) 中报告的节点拓扑和互连。每 101 次迭代触发手动垃圾回收。该调度在一个热身后稳态阶段和三个连续的退火延续中实现,总结于表 2 (https://arxiv.org/html/2607.09424#S2.T2);每个阶段消耗的数据混合在第 3 节 (https://arxiv.org/html/2607.09424#S3) 中有记录:

- •基础预训练(稳态)。在 20T EN/DE 混合(见第 3.2 节 (https://arxiv.org/html/2607.09424#S3.SS2))上进行 794,728 次迭代(19,999,984,975,872 个 token,约 20T)。经过 254 次迭代热身到峰值学习率 1e-3 后,训练在 WSD 稳定平台期进行。
- •主退火(衰减)。在高品质 5T EN/DE 混合(见第 3.3 节 (https://arxiv.org/html/2607.09424#S3.SS3))上进行 198,682 次迭代(4,999,996,243,968 个 token,约 5T)的延续,应用 WSD minus_sqrt 从 1e-3 衰减到 1e-5。此延续后的配置总数为 993,410 次迭代。
- •恒定退火

相似文章

一款面向德语和英语的主权开源基础模型

Hugging Face Daily Papers

SoofiS30B-A3B 是一款面向德语和英语的主权开源混合专家(MoE)Mamba Transformer 基础模型,每 token 仅激活 30B 参数中的 3B,并在基准测试中表现强劲。

Soofi – 主权开源基础模型

Hacker News Top

Soofi 推出了 Soofi S,这是一个拥有300亿参数的混合专家开源基础模型,在27万亿个token上训练,面向德语和英语的工业AI应用。该模型是欧洲主权AI计划的一部分。

Apertus – 主权AI的开放基础模型

Hacker News Top

Apertus 是由瑞士AI计划开发的一款完全开放的主权AI基础模型。它拥有开放权重、开放数据、开放科学,符合欧盟AI法案,在8B和70B参数规模上与顶级开放模型具有竞争力,支持超过1000种语言。

Sumi:从头训练的开放均匀扩散语言模型

Hugging Face Daily Papers

Sumi 是一个 7B 参数的均匀扩散语言模型,在 1.5T token 上从头预训练,在知识和推理任务上取得了有竞争力的性能,同时完全开源,发布了模型权重和训练方案。