HEBATRON:一款专攻希伯来语的开权重大语言模型

arXiv cs.CL 模型

摘要

Hebatron 是一款基于 NVIDIA Nemotron-3 混合专家(MoE)架构构建的、专攻希伯来语的新开源权重大型语言模型。该模型在实现高效推理的同时展现出强大的推理能力。它是首个针对该架构进行的语言特定适配版本,并支持原生长上下文处理。

arXiv:2605.11255v1 公告类型:新发布 摘要:我们推出了 Hebatron,这是一款基于 NVIDIA Nemotron-3 稀疏混合专家(MoE)架构构建的、专攻希伯来语的开权重大型语言模型。其训练采用三阶段由易到难的课程学习策略,并结合持续的反遗忘锚定技术,随后在 200 万条双语(希伯来语-英语)样本上进行监督微调。仅课程顺序这一项优化,便比反向配置带来了 3 个百分点的综合基准性能提升。Hebatron 在希伯来语推理任务上的平均准确率达到 73.8%,优于 DictaLM-3.0-24B-Thinking(68.9%),并在 GSM8K-HE 和以色列常识问答任务上与 Gemma-3-27B-IT 保持竞争力。在拥有 300 亿参数的模型中,每次前向传播仅激活 30 亿参数,在高达 65,536 个 token 的原生长上下文长度下,推理吞吐量约为后者的 9 倍。据我们所知,这是首个针对任何目标语言进行的 Nemotron-3 架构语言特定适配,也是首个支持原生长上下文的开权重希伯来语专用 MoE 模型。模型权重已公开发布,以支持希伯来语及闪米特语系自然语言处理的进一步研究。
查看原文
查看缓存全文

缓存时间: 2026/05/13 06:09

# 一份面向希伯来语的开源权重混合专家大语言模型技术报告
来源: https://arxiv.org/html/2605.11255
Dan Revital¹¹footnotemark:1 Ori Bar Joseph¹¹footnotemark:1 Smadar Arvatz Or Levi Tal Geva Shaltiel Shmidman Amir DN Cohen Noam Ordan Omer Baruch Kate Zinkovskaia Zevi Apini Sarel Weinberger PwC Next 通讯作者

(2026年4月26日)

###### 摘要

我们提出了 **Hebatron**,这是一种基于 NVIDIA Nemotron-3 稀疏混合专家(Mixture-of-Experts, MoE)架构构建的、专门针对希伯来语的开源权重大型语言模型。训练采用了一个三阶段的由易到难课程学习策略,并结合了持续的抗遗忘锚定,随后在200万条双语(希伯来语-英语)样本上进行监督微调。仅凭这种课程顺序,相比反向配置即可在综合基准测试中获得3分的提升。Hebatron 在希伯来语推理任务上的平均得分达到73.8%,优于现有的最佳开源希伯来语模型,并在 GSM8K-HE 和 Israeli Trivia 等任务上与 Gemma-3-27B-IT 保持竞争力。该模型在30亿参数模型中每次前向传播仅激活约30亿参数,在原生支持高达65,536 token的上下文长度下,实现了约9倍更高的推理吞吐量。据我们所知,这是首次将 Nemotron-3 架构适配用于任何目标语言,也是首款支持原生长上下文的开源权重希伯来语专用 MoE 模型。模型权重已公开发布,以支持希伯来语及闪米特语族自然语言处理领域的进一步研究。

## 1 引言

大型语言模型(LLMs)的快速进步彻底改变了自然语言处理的格局。这些模型现在能够在广泛的推理、生成和理解任务中实现人类级别的表现(OpenAI et al., 2024; Gemini Team et al., 2024; Anthropic, 2024)。然而,前沿模型的开发绝大多数仍集中在以英语为中心的训练方案上。非英语语言,特别是形态复杂、资源匮乏的语言,在预训练语料库和训练后对齐流程中的代表性严重不足(Touvron et al., 2023; Joshi et al., 2020)。这种不平衡导致了一个持续存在且记录在案的性能差距:英语使用者与非英语使用者在获取能力强且具备文化根基的人工智能系统方面存在差异。

希伯来语作为语言模型本地化的目标既极具吸引力又充满挑战。作为一种拥有丰富形态结构、非连结性模板派生以及因元音符号(niqqud)可选使用而导致广泛正字法歧义的闪米特语,希伯来语对语言模型架构和预训练数据提出的要求与印欧语系根本不同(Chriqui & Yahav, 2022; Shmidman et al., 2024)。希伯来语单词通过词根-模式形态学形成,同一个三或四个辅音的词根可以根据 binyan(动词式)和上下文表现为数十种形态上截然不同的形式。这种模板结构,加上附着在词干前的大量前缀介词、连词和确定性标记,给分词、引理化和下游语义理解带来了严峻挑战,而标准的多语言分词器和模型在此方面表现不佳(Antoun et al., 2020; Chriqui & Yahav, 2022)。除了形态学外,希伯来语是一种从右向左书写的语言,却嵌入在主要从左向右的数字生态系统中,且涵盖文学、法律、新闻和学术话语的高质量数字化希伯来语文本语料库比英语网络文本小几个数量级。这些特性共同使得希伯来语在大规模预训练的实际意义上成为一种资源匮乏的语言,尽管它拥有数百万母语使用者和充满活力的数字存在感。

此前关于阿拉伯语 NLP(Antoun et al., 2020; Inoue et al., 2021)、印地语系语言(Kakwani et al., 2020; Doddapaneni et al., 2023)和东亚语言(Cui et al., 2023; Fujii et al., 2024)的研究表明,通用多语言模型在需要深厚文化知识、形态精确性和语用推理的任务上,始终表现不如语言专用模型。主权语言模型开发的新兴范式显示出作为缩小这一差距的可扩展策略的巨大潜力,而无需承担从头训练的全部计算成本。最近,这一范式在两个紧密相关的语言领域中产生了最先进的结果:DictaLM-3.0(Shmidman et al., 2026),通过1300亿希伯来语 token 的大规模持续预训练,确立了当前开源权重希伯来语模型的前沿;以及 Command-R7B-Arabic(Cohere, 2025),展示了针对阿拉伯语(一种形态学相似的闪米特语)本地化的紧凑型模型在语言专用基准上可以匹配或超越大得多的通用模型。这两个案例都强化了领域自适应预训练研究的核心发现(Gururangan et al., 2020; Howard & Ruder, 2018):只要仔细设计数据分布以保留跨语言推理的 parity,在高质量、领域内数据上进行持续预训练就能在下游任务中带来稳健的提升(Pfeiffer et al., 2020; Üstün et al., 2024)。

有效本地化的一个关键维度是选择用于初始化持续预训练的基础模型。我们基于 NVIDIA Nemotron-3-Nano-30B-A3B-Base-BF16 模型(NVIDIA, 2025)构建,这是一种在大规模公开记录的预训练语料库上训练的稀疏混合专家(MoE)架构。至关重要的是,Nemotron 预训练数据分布的公开可用性使得在本地化过程中战略性地重新整合原始源数据成为可能,特别是高质量的英语推理语料库。这种透明度作为一个至关重要的抗遗忘锚点:通过从基础模型原始训练信号中精选的子集进行联合训练,我们缓解了基线推理和英语能力方面的灾难性遗忘,这是在天真的持续预训练流程中一致观察到的失败模式(Goodfellow et al., 2013; Kirkpatrick et al., 2017; Luo et al., 2023)。MoE 架构的可扩展效率进一步确保了30亿参数模型在整个本地化过程中保持强大的计算-性能特征(Fedus et al., 2021; Jiang et al., 2024)。

除了基础模型的选择外,训练语料库的设计遵循了 BLOOM(Le Scao et al., 2022)、MADLAD-400(Kudugunta et al., 2023)和 Aya(Üstün et al., 2024)等大规模多语言预训练倡议中确立的原则,在这些项目中,精心策划、语言平衡的数据混合物被证明是下游语言质量和推理泛化的决定性因素。具体到闪米特语建模,最新且具有指导意义的先例是希伯来语的 DictaLM-3.0(Shmidman et al., 2026)和阿拉伯语的 Command-R7B-Arabic(Cohere, 2025),两者都证明,专门针对捕捉模板形态、正字法变异和基于文化的常识的高质量预训练语料库,是在形态丰富、资源匮乏的语言中实现竞争性性能的先决条件。FineWeb2(Penedo et al., 2024)是训练时可用的最全面的高质量多语言网络抓取数据,构成了我们语料库中主要的网络源希伯来语成分。

我们预训练课程的顺序结构受到关于 LLM 预训练中数据排序日益增长的证据的启发。Bengio et al. (2009) 确立了基础原则:从易到难地呈现训练示例可以加速学习并提高泛化能力。最近的工作在 LLM 规模上验证了这一点:Chen et al. (2023) 证明,由易到难的课程顺序一致地加速收敛并带来持续的下游改进。在我们的希伯来语本地化设置中,这促使我们首先在形式结构化、形态规则的数据源(如文学文本、法律文件、议会记录和研究语料库)上初始化预训练,然后再让模型接触社交媒体和非正式网络内容中更嘈杂的模式。上下文长度扩展作为第三个顺序阶段处理,遵循既定的渐进式缩放实践(Peng et al., 2023; Chen et al., 2024),采用经过过滤的专用长文档语料库(文档超过2000字),支持高达65,536 token 的连贯多文档推理。

在持续预训练(CPT)阶段之后,通过在200万高质量样本的双语希伯来语-英语混合数据上进行监督微调(SFT),对本地化基础模型进行指令调优,以实现对指令遵循和多步推理的对齐(Ouyang et al., 2022; Wang et al., 2022; Wei et al., 2022)。

本文的主要贡献如下:

- **希伯来语专用大语言模型**:基于 Nemotron-3-Nano-30B-A3B-Base-BF16 MoE 架构的 Hebatron(Hebatron Team, 2026),通过结构化的三阶段课程预训练管道,在约1540亿个希伯来语和英语 token 上进行训练,支持高达65,536 token 的原生上下文长度。
- **新型架构-语言本地化**:据我们所知,这项工作代表了首次记录的完整本地化管道实例——整合了大规模持续预训练(CPT)和监督微调(SFT)——用于任何目标语言,利用 NVIDIA Nemotron-3 稀疏混合专家(MoE)架构(NVIDIA, 2025)。
- **课程排序的本地化策略**:我们通过实证验证,由易到难的数据排序(正式数据源先于口语和社交媒体内容)比反向排序产生更优越的形态质量和基准性能,希伯来语综合基准提高了3.01分(68.00 vs. 64.99)。
- **大规模多领域希伯来语预训练语料库**:涵盖三个阶段课程中的网络、文学、法律、政府、学术、新闻和社交媒体来源,总计约1540亿 token。
- **专用希伯来语对齐语料库**:200万个指令调优样本,结合了来自英语推理管道的本地化知识蒸馏,以及针对形态精确性的程序生成希伯来语 IFEval 数据集。
- **全面评估**:我们的模型在希伯来语推理上的平均得分达到73.8%,在自动基准测试中超过 DictaLM-3.0-24B-Thinking(68.9%),并在人类偏好评估中显著优于它(68.8%的决定性投票)。它在事实性和基于文化的希伯来语知识方面与 Gemma-3-27B-IT 保持竞争力,包括 Israeli Trivia(72.1% vs. 70.4%)和 GSM8K (HE)(83.3% vs. 82.8%),同时运行的活跃推理计算量约为后者的九分之一。英语推理保真度得以保留,英语平均得分为86.0%。值得注意的是,与 Gemma-3-27B-IT 和 DictaLM-3.0-24B-Thinking 相比,该模型的推理速度大约快9倍,同时运行的活跃推理计算量仅为后者的九分之一左右,凸显了其效率优势。
- **开源权重模型发布**:所有模型权重均在宽松许可下公开发布,使其成为首款支持原生65k token 上下文的开源权重希伯来语专用 MoE 语言模型,为研究社区提供了进一步希伯来语 NLP 开发的可复现基础。

## 相关工作

关于涵盖语言特定适配、闪米特语建模演变以及训练效率最新进展的先前研究的详细综述,请参阅补充材料。

## 2 方法

### 2.1 数据

#### 2.1.1 持续预训练(CPT)

##### 第一阶段 - 高质量本地化种子

网络/通用内容占训练权重的36.85%,作为通过广泛、高质量的通用领域数据锚定希伯来语语言流利度的主要基础。这一基础由精心策划的文化与学术、法律与政府以及新闻与媒体来源集合补充,以确保深入的领域根基和风格多样性。为了保留跨语言推理的保真度,混合中集成了包含 Nemotron 语料库的大量英语组件,为模型的分析能力提供必要的 STEM 与推理脚手架。完整的 token 分布在表1中详述。

表1:第一阶段综合多语言语料库:按语言和类别划分的静态 Token 分布
参见标题
图1:第一阶段的数据混合。

##### 第二阶段 - 口语和广泛领域扩展

第二阶段的希伯来语部分占总 token 池的约68.5%,反映了该阶段深化口语和广泛领域覆盖的核心目标。新闻与社交媒体构成了最大的一块,为259.3亿 token(27.2%),涵盖了从正式新闻到非正式用户生成内容的完整语域范围,并作为当代希伯来语用法和命名实体接地的主要来源。网络组件(221.6亿 token,23.3%)提供了广泛的日常词汇覆盖,而文化与学术来源(147.1亿 token,15.5%)保留了第一阶段建立的形式语域根基,确保接触更嘈杂的数据不会降低形态精确度。较小但有意

相似文章

nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 · Hugging Face

Reddit r/LocalLLaMA

NVIDIA发布Nemotron-3-Ultra-550B-A55B,这是一个5500亿参数(550亿活跃参数)的前沿大语言模型,采用混合LatentMoE架构,结合Mamba-2、MoE和注意力层,支持高达100万令牌的上下文长度和可配置的推理模式。它支持11种语言,并针对复杂的智能体工作流、长上下文分析和高精度推理进行了优化。

Nemotron - 深度之王?4个≤120B模型的对比

Reddit r/LocalLLaMA

使用Strix Halo硬件对四个大型语言模型(≤120B参数)在深度上下文性能上的比较。与GPT-OSS和Qwen模型相比,Nemotron Super在深度上下文中的提示处理速度表现出色。