一款面向德语和英语的主权开源基础模型
摘要
SoofiS30B-A3B 是一款面向德语和英语的主权开源混合专家(MoE)Mamba Transformer 基础模型,每 token 仅激活 30B 参数中的 3B,并在基准测试中表现强劲。
查看缓存全文
缓存时间: 2026/07/13 07:50
论文页面 - 一个面向德语和英语的主权开源基础模型
来源:https://huggingface.co/papers/2607.09424
作者:
(作者列表保留英文,因其为专有名词)
摘要
我们提出了 SoofiS30B-A3B,一个面向德语和英语的主权开源混合专家(MoE)Mamba Transformer 基础模型。其混合设计使每个 token 仅激活 30B 参数中的 3B,并使推理缓存随着上下文增长而近乎恒定,从而在长上下文、高并发的部署场景中,相比密集模型具有决定性的吞吐量优势。SoofiS 在约 27 万亿个 token 上进行了预训练,并刻意提高了德语的权重;在英语和德语的综合基准测试中,SoofiS 与参数量 14B 到 27B 的密集模型表现相当,同时在 17 个开放基础模型中取得了两种语言下的最佳代码聚合得分,并且在我们的比较中超越了所有欧洲主权基线模型,其中包括一些活跃参数远大于它的模型。在所有完全开放的模型中,SoofiS 获得了最高的英语和德语评估得分,领先于 Olmo 32B 和 Apertus 70B。SoofiS 在德国工业人工智能云(German Industrial AI Cloud)上完成了端到端构建,该云是由德国电信(Deutsche Telekom)在慕尼黑运营的主权级 HPC 人工智能基础设施。SoofiS 将以高度宽松、开放获取的条款发布:包括权重、选定的中间检查点、完整的按来源数据统计、超参数以及训练和评估代码。在来源许可证允许的情况下,数据构建产物将以宽松许可证发布;商业许可的来源则附带聚合统计数据和精确混合核算文档。
查看 arXiv 页面 (https://arxiv.org/abs/2607.09424)
查看 PDF (https://arxiv.org/pdf/2607.09424)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09424)
在你的智能体中使用此论文:
hf papers read 2607.09424
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型
0
没有模型链接到此论文
请在模型的 README.md 中引用 arxiv.org/abs/2607.09424,以将其链接到此页面。
引用此论文的数据集
0
没有数据集链接到此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2607.09424,以将其链接到此页面。
引用此论文的 Spaces
0
没有 Space 链接到此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2607.09424,以将其链接到此页面。
包含此论文的收藏夹
0
没有收藏夹包含此论文
请将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
一款面向德语和英语的主权、开源基础模型
Soofi S 30B-A3B是一款主权、开源的混合专家基础模型,专为德语和英语设计,预训练于27万亿个token。它在基准测试中与密集的14-27B模型表现相当,同时提供卓越的长上下文吞吐量,并优于所有欧洲开源基线模型。
Soofi – 主权开源基础模型
Soofi 推出了 Soofi S,这是一个拥有300亿参数的混合专家开源基础模型,在27万亿个token上训练,面向德语和英语的工业AI应用。该模型是欧洲主权AI计划的一部分。
德国AI联盟发布Soofi S,一款在英语和德语基准测试中均名列前茅的开源300亿参数模型
德国AI联盟发布Soofi S,一款开源的300亿参数混合专家模型,在英语和德语基准测试中取得最高分,采用混合Mamba-Transformer架构实现高效长上下文推理。
Apertus – 主权AI的开放基础模型
Apertus 是由瑞士AI计划开发的一款完全开放的主权AI基础模型。它拥有开放权重、开放数据、开放科学,符合欧盟AI法案,在8B和70B参数规模上与顶级开放模型具有竞争力,支持超过1000种语言。
@jinyuhou0: 在主流基准测试中,我们的30B模型与规模大20-30倍的系统(gpt-5.4-xhigh、DeepSeek-V3.2、Kimi-K2.5)匹敌,而……
一款新的30B模型在主流基准测试中与规模大20-30倍的系统匹敌,同时相比同类30/32B智能体大语言模型,使用的推理令牌减少高达95%。这是通过一个学习型配置器实现的,该配置器决定何时以及如何进行推理。模型和代码已开放。