标签
Soofi 推出了 Soofi S,这是一个拥有300亿参数的混合专家开源基础模型,在27万亿个token上训练,面向德语和英语的工业AI应用。该模型是欧洲主权AI计划的一部分。
本文介绍了ChristBERT,一个基于RoBERTa的面向德国临床NLP的领域特定语言模型家族,并在医学命名实体识别和文本分类任务上评估了三种领域适应策略(继续预训练、从头预训练和词汇适应),取得了最先进的结果。
KletterMix 是一个高质量的德语预训练语料库,通过将最先进的英语预训练数据集翻译成德语构建而成,同时保留其结构和多样性。控制实验表明,在 KletterMix 上训练的模型在德语基准测试中取得了可衡量的改进。