North Small Translate: 先进的性价比翻译 (Cohere CAT+)
摘要
North Small Translate 是一个基于LLM的开源机器翻译模型,拥有250亿活动参数,无需在推理时进行昂贵推理,即可在其类别中实现跨50种语言的顶级性能。
arXiv:2609.13916v1 公告类型:新
摘要:我们推出 North Small Translate,一个开源权重的基于LLM的机器翻译(MT)模型,具备指令跟随能力,基于与 Cohere 的 Command A Plus 相同的架构构建,这是一个专家混合架构,总参数2180亿,其中活动参数250亿。North Small Translate 通过难度采样获取具有挑战性的文档进行训练,并采用五步训练协议,结合监督微调、直接偏好优化和在线强化学习。我们优先考虑通过非推理基础模型提高吞吐量,并辅以可选的代理能力以提升翻译质量。North Small Translate 被训练来执行与MT相关的任务,包括后编辑和质量估计,以及一般指令跟随等相关任务。该模型在参数低于1T的模型类别中,实现了跨50种语言的顶级MT性能,且无需在推理时运行昂贵的推理过程。
查看缓存全文
缓存时间: 2026/09/15 08:46
# 北方小译:先进高性价比翻译模型(Cohere CAT+) 来源:https://arxiv.org/html/2609.13916 亚历山大·贝拉德、菲尔·布伦森、塞缪尔·卡希维贾亚、肖恩·卡西尼、尼古拉斯·弗罗斯特、奥娜·德·吉伯特、艾丹·戈麦斯、尼蒂亚·戈文达拉詹、清野俊雄、奥利维亚·拉舍、劳伦斯·罗杰斯、凯利·马尔基西奥、尼基塔·莫格、亚什·莫尔、卡米拉·莫兰-伊达尔戈、倪奕阳、迈克尔·萨克斯、特里莎·斯塔罗斯蒂娜、丹·范·斯蒂格特、斯宾塞·拉里克、塞巴斯蒂安·文森特、伊万·张、Cohere团队 邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 我们推出**North Small Translate**,这是一个开放权重的基于大语言模型的机器翻译模型,具备指令遵循能力。它建立在Cohere的Command A+同一基础架构上,采用混合专家架构,在2180亿总参数中具有250亿活跃参数。North Small Translate通过困难样本采样训练以获取挑战性文档,并采用五步训练协议,结合监督微调、直接偏好优化和在线强化学习。我们通过非推理基础模型优先保证吞吐量,并辅以可选的智能体能力以提升翻译质量。North Small Translate训练用于执行机器翻译相关任务,包括后编辑和质量估计,以及通用指令遵循等相关任务。该模型在参数量低于1T的模型类别中,在50种语言上实现了顶尖的机器翻译性能,且推理时无需运行昂贵的推理计算。 | 参数总量(活跃) | GEMBA WMT26 | xCOMETxl | WMT24++ | 术语 | 长上下文 | 结构化翻译 | |---|---|---|---|---|---|---| | North Small Translate (Agentic) 218B (25B) | 84.4 | 80.7 | 87.9 | 47.8 | 93.3 | | North Small Translate 218B (25B) | 83.6 | 80.6 | 89.7 | 48.9 | 93.7 | | Mistral Large 3 675B (41B) | 81.6 | 78.3 | 91.2 | 20.0 | 93.8 | | Qwen 3.5 397B 397B (17B) | 81.6 | 78.5 | 87.0 | 19.5 | 59.4 | | DeepL NextGen | 81.4 | 81.8 | 47.8 | 56.5 | 64.5 | | Gemma 4 31b 31B (31B) | 79.5 | 79.2 | 92.1 | 19.4 | 95.1 | | Inkling Small 276B (12B) | 78.5 | 78.7 | 91.1 | 21.5 | 91.3 | | Muse Glimmer 30B 30B (30B) | 78.2 | 77.7 | 90.1 | 32.5 | 91.7 | | Command A+ 218B (25B) | 76.5 | 81.0 | 68.7 | 30.5 | 73.7 | | GLM 5.2 744B (40B) | 76.5 | 78.8 | 78.2 | 28.6 | 92.1 | | Mistral Medium 3.5 128B (128B) | 75.7 | 76.7 | 90.3 | 19.3 | 94.2 | | GPT-OSS 120B 117B (5B) | 72.3 | 76.6 | 83.8 | 20.8 | 93.2 | | Command A Translate (2025) 111B (111B) | 70.0 | 76.9 | 56.9 | 0.0 | 79.5 | | Google Translate | 68.2 | 80.8 | 38.1 | 21.3 | 48.8 | | Nemotron 3 Ultra 550B 550B (55B) | 67.1 | 84.8 | 19.7 | | | | Qwen 3.6 27B 27B (27B) | 61.9 | 89.2 | 28.9 | | | 表1:我们的模型与其他参数低于1T的顶尖系统的聚合结果。 ## 1 引言 近年来,机器翻译领域经历了深刻变革,几乎已完全过渡到以大语言模型为核心的范式,将跨语言生成视为一项复杂的指令遵循任务。这一范式转变释放了前所未有的能力,使模型能够利用广泛的上下文理解,执行鲁棒的翻译,并使翻译适应各种请求。我们推出了**North Small Translate**(以Cohere CAT+名义提交给WMT通用机器翻译共享任务),这是我们基于Cohere的Command A+同一基础构建的最佳性能翻译系统。它是一个稀疏混合专家Transformer模型,在2180亿总参数中具有250亿活跃参数。North Small Translate专为效率而构建。虽然大多数大语言模型依赖测试时推理来实现最先进的性能,但长的推理链为生产级翻译带来了不可接受的延迟和计算开销。模型吞吐量是实际机器翻译部署的首要目标,因此我们明确将North Small Translate训练为非推理模型。对于延迟不敏感的应用,我们可选的*智能体翻译*框架弥合了因缺失中间推理步骤而可能产生的质量差距。North Small Translate通过五个不同的训练步骤实现了顶尖的翻译质量:(i) 粗粒度SFT以建立通用非机器翻译指令遵循能力并扩展基础模型的语言覆盖范围;(ii) 使用高度精选的合成数据集进行细粒度SFT,以提高核心机器翻译质量和相邻任务(如错误检测和后编辑);随后是三个主要关注人类对齐翻译质量的步骤:(iii) DPO;(iv) 使用LLM-as-a-Judge奖励的在线强化学习;(v) 最后一个采用降低学习率的轻量DPO,以解决引入的边缘案例回退问题。我们以Cohere CAT+名称参与了WMT 2026通用机器翻译共享任务、术语共享任务以及自动机器翻译评估共享任务。我们的提交专注于干净的性能,不依赖任何专门的搜索启发式或推理技巧,如最小贝叶斯风险解码。我们也未使用智能体翻译。111 利益冲突披露:主要作者也是WMT通用机器翻译共享任务的组织者。通用机器翻译中的一个领域包含视频作为源,我们使用Cohere Transcribe222 https://cohere.com/blog/transcribe 获取英文视频的文本转录,而中文和捷克语源数据则依赖官方提供的转录。 ## 2 训练细节 ### 2.1 模型架构 预训练语言列表为:阿拉伯语、孟加拉语、捷克语、丹麦语、荷兰语、英语、菲律宾语、芬兰语、法语、德国、希腊语、希伯来语、印地语、印度尼西亚语、意大利语、日语、韩语、马来语、挪威语、波斯语、波兰语、葡萄牙语、旁遮普语、罗马尼亚语、俄语、简体中文、西班牙语、瑞典语、泰米尔语、泰卢固语、泰语、繁体中文、土耳其语、乌克兰语、乌尔都语、越南语。后期训练扩展的语言列表为:阿尔巴尼亚语、保加利亚语、加泰罗尼亚语、克罗地亚语、爱沙尼亚语、匈牙利语、冰岛语、爱尔兰语、拉脱维亚语、立陶宛语、马耳他语、塞尔维亚语、斯洛伐克语、斯洛文尼亚语。 ### 2.2 训练方法 我们基于我们之前模型以及我们之前的Command-A-Translate的发现进行构建,该研究展示了直接偏好优化训练步骤对翻译质量的影响。我们使用五个不同的训练步骤,每个步骤侧重于不同的方面: 1. 1. **初始粗粒度SFT**:覆盖通用指令遵循能力,并将语言覆盖范围从预训练的35种语言扩展到50种语言。我们微调了四个不同的模型,并将它们合并。 2. 2. **细粒度SFT**:主要使用合成数据集专注于提高机器翻译质量,并改进机器翻译相关任务,如错误检测、术语或后编辑。 3. 3. **DPO**:主要专注于提高质量。 4. 4. **在线强化学习**:使用GSPO和LLM-as-a-Judge作为奖励信号的在线强化学习,以提升性能并增加充分性。 5. 5. **采用降低学习率的轻量针对性DPO**:用于修复剩余问题,特别是强化学习步骤引入的少数问题。 表2突出了每个训练步骤如何提高了机器翻译性能。我们看到除强化学习外,每一步都有显著收益。虽然此步骤提高了一些分数,特别是充分性,但它降低了少数低资源语言的性能,这是由于LLM评判模型在这些语言上的弱点。为了解决上述回退问题,我们引入了最后一个采用降低学习率并仅使用5个预热步骤的DPO步骤。在此步骤中,我们仅专注于少数有问题的语言和能力。 | 步骤 | 机器翻译质量 | |---|---| | 粗粒度SFT | 71.3% | | 细粒度SFT | 76.2% | | DPO | 80.1% | | 在线强化学习 | 80.0% | | 轻量DPO | 81.8% | 表2:在WMT25评估中使用GEMBA-ESA在14种语言上的平均结果展示的训练进展。 ### 2.3 数据准备 虽然主要目标是构建强大的机器翻译模型,但我们也专注于构建一个强大的指令遵循模型,该模型在机器翻译相关任务(如后编辑、术语遵循、质量估计或结构化翻译)上同样表现出色。对于每个训练集,我们都检查每个翻译对是否经过了一套自动化验证器的处理,旨在消除噪声或格式错误的文本。具体而言,我们通过验证行和段落对齐来强制执行严格的结构一致性,确保源段和目标段包含完全相同数量的行和段落。此外,我们应用语言识别并过滤掉不需要的语码转换实例。我们的过滤管道还删除了包含损坏Unicode字符的段,并依赖各种其他内部分类器来检测和丢弃异常。 #### 2.3.1 机器翻译的质量 为顶尖机器翻译系统策划训练语料库的一个主要挑战是真正困难源材料的稀疏性,正如我们在Kocmi等人(2025a)中强调的那样。在我们初始的粗粒度SFT阶段之后,模型在超过90%的训练文档中翻译没有重大错误。因此,随机采样源文本会产生弱学习信号,无法推动模型的质量边界。我们使用困难样本采样,将我们的合成生成专门集中在模型可以学习的问题实例上。基于我们之前的工作,我们扩展了困难样本采样,使用具有最小后期训练的初始基础模型作为基线模型,并仅保留模型产生重大错误或翻译质量低于并行数据中人类参考的文档。对于每个源文档,我们随机选择一个高资源目标语言并使用早期阶段模型进行翻译。然后使用评判模型自动评估生成的翻译中的错误。对于单语数据,如果翻译基本无错误,则源段被分类为“容易”并从候选池中移除。对于并行数据,我们检查翻译是否优于人类参考以将其视为“容易”。通过积极过滤掉容易翻译的段,我们提炼出一个高度浓缩的困难文本语料库。这确保了我们后续的合成数据生成被分配给模型最需要改进的文档。为了在所有支持的语言上实现顶尖的机器翻译性能,我们使用两种不同的数据合成和精炼策略构建我们的训练语料库,我们称之为*最佳语言前向翻译*和*后编辑驱动偏好蒸馏*。两种方法都旨在最大化训练信号的质量和多样性,而无需依赖人工标注的并行数据(我们仅在训练的第一阶段使用人工标注数据)。 **最佳语言前向翻译**依赖于标准的前向翻译方法结合最佳N选择。我们使用一组顶尖的语言特定专家模型,对于每种语言,我们选择表现最佳的专家为给定的源文档生成翻译。为确保广泛的多语言覆盖并明确改善跨语言转移,我们在生成过程中随机分配目标语言。虽然大部分源文本是英语,但有相当一部分由非英语源组成,从而产生大量的直接非英语到非英语翻译对。生成的翻译候选随后由评判模型评估,只有当其分数高于70 GEMBA-ESA时才被接受。我们在第2.4节描述评分的详细信息,因为我们在此工作中都使用这种方法。 我们的第二种策略,**后编辑驱动偏好蒸馏**,是我们数据准备管道中最关键的部分,也是DPO阶段的主要驱动力。核心目标是在离线设置中生成接近在策略上的训练数据,创建高效且直接针对模型自身弱点的偏好对。编排管道在三个不同的步骤中运行: 1. 1. 使用当前候选模型生成草稿翻译。 2. 2. 一个单独的评判模型识别并标注草稿中的错误区间。如果没有错误,则该样本被视为“容易”并从训练数据中丢弃。 3. 3. 第三个模型充当自动化后编辑器,接受草稿并修复错误。 4. 4. 我们迭代步骤2-3,直到发现没有重大错误,或者超过10次迭代。 这种多模型编排过程产生了一个完美对齐的偏好对:来自候选模型的原始有缺陷输出作为较差的完成,而纠正后的后编辑版本作为首选完成。因为错误的翻译直接来自候选模型,生成的数据集非常接近在策略上的机器翻译数据。这使得离线DPO训练能够以在线强化学习的精度运行,惩罚模型的实际失败模式。这种编排方法对于修复持续存在的、特定于模型的错误以及推动我们在DPO阶段观察到的最显著的质量改进至关重要。 #### 2.3.2 指令遵循 为了确保我们的机器翻译模型具有可接受的通用指令遵循能力(这将加强翻译相关任务和遵循特定的机器翻译指令),我们在第一个SFT阶段包含了与机器翻译无关的指令数据。我们使用了一些用于训练Command A+的仅英语单轮数据集。此外,我们包含了使用通用多语言提示的多语言数据集。我们从所有重复使用的数据集中移除了推理链。我们在第二个SFT阶段进一步使用了所有上述数据,但进行了显著的降采样。 #### 2.3.3 结构化翻译 “结构化翻译”是指翻译嵌入在数据格式(如JSON或HTML)中的自然语言而不破坏其底层语法的过程。这是一个关键特性,特别是在翻译网页、文档或训练数据时。虽然上述通用指令遵循数据集包含各种格式,但结构化翻译我们仅关注JSON和HTML格式。我们以两种方式准备数据:自然发生的结构化数据和将现有高质量机器翻译数据集中的段落或句子组合成多样化的结构。对于前者,我们依赖于我们内部包含JSON的数据集,然后从各种网络数据集中提取HTML数据。对于后者部分,这使用我们高质量句子语料库中的顶级段落完成。构建这些源数据后,我们使用内部模型将其翻译成35种语言。这些翻译是按字段进行的,也包括完整的结构翻译。在准备训练数据时,我们添加了提示指令可控性,涵盖从翻译源中所有结构到仅关注翻译JSON中少数键的不同翻译级别。最后,对翻译进行了结构保留和翻译质量过滤。除了SFT之外,我们还创建了一个DPO数据集,专门针对我们微调模型表现出的特定结构化错误。
相似文章
North Small Translate 模型卡 (8分钟阅读)
CohereLabs 发布了 North Small Translate,这是一个开放权重的稀疏混合专家模型,拥有250亿活跃参数,用于支持50种语言的高质量机器翻译。
Translate-R1:基于强化学习的成本感知翻译工具使用
Translate-R1引入了一种基于强化学习的方法,用于大语言模型中的成本感知翻译工具使用。该模型根据自身的理解能力和一个成本敏感性参数,学会决定何时翻译输入,从而在多种语言之间实现帕累托最优权衡。
Hy-MT2:一套快速、高效且强大的多语言翻译模型,面向实际应用
Hy-MT2 是腾讯推出的一套快速高效的多语言翻译模型,提供 1.8B、7B 和 30B-A3B 三种尺寸,支持 33 种语言,性能超越此前开源和商业模型。
@FeitengLi: Hy-MT2 新的开源多语言翻译模型 能力可以跟顶尖大模型匹配、支持 33 种语言之间的互译,而且具备灵活的 Instruct 能力,实现了 2-bit 量化不足 500MB 的空间占用 可以很好的跑在端侧 https://modelsc…
Hy-MT2 is a new open-source multilingual translation model from Tencent Hy that supports 33 languages, offers flexible instruction capabilities, and achieves 2-bit quantization under 500MB for on-device deployment.
低资源Tangkhul-英语神经机器翻译
介绍了一个针对严重资源匮乏的Tangkhul-英语语言对的神经机器翻译系统,通过微调ByT5-large和mT5-small模型,在BLEU、chrF++、BERTScore和COMET评分上取得了优异成绩。