Hy-MT2:一套快速、高效且强大的多语言翻译模型,面向实际应用

arXiv cs.CL 模型

摘要

Hy-MT2 是腾讯推出的一套快速高效的多语言翻译模型,提供 1.8B、7B 和 30B-A3B 三种尺寸,支持 33 种语言,性能超越此前开源和商业模型。

arXiv:2605.22064v1 公告类型: 新 摘要:Hy-MT2 是一系列快速思考的多语言翻译模型,专为复杂的真实场景设计。它包括三种模型尺寸:1.8B、7B 和 30B-A3B(MoE),均支持 33 种语言之间的翻译,并能有效遵循多语言翻译指令。在设备端部署方面,借助 AngelSlim 1.25 位极端量化,1.8B 模型仅需 440 MB 存储空间,推理速度提升 1.5 倍。多维度评估表明,Hy-MT2 在通用、真实业务、特定领域以及指令跟随翻译任务上均表现出色。7B 和 30B 模型在快速思考模式下优于 DeepSeek-V4-Pro 和 Kimi K2.6 等开源模型,而轻量级 1.8B 模型整体上也超越了微软和豆包等提供商的主流商业 API。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:45

# 一个快速、高效、强大的多语言翻译模型家族:Hy-MT2

来源:https://arxiv.org/html/2605.22064
## ![[未配图]](https://arxiv.org/html/2605.22064v1/logo/equipped_lion_stage_3_teen_headset.png)Hy-MT2: 一个快速、高效、强大的多语言翻译模型家族

###### 摘要

Hy-MT2 是一个面向复杂真实世界场景的快速思考多语言翻译模型系列。它包含三种模型尺寸:1.8B、7B 和 30B-A3B (MoE),均支持 33 种语言之间的翻译,并能有效遵循多种语言的翻译指令。针对设备端部署,结合 AngelSlim 1.25-bit 极端量化技术,1.8B 模型仅需 440MB 存储空间,推理速度提升 1.5 倍。多维评估表明,Hy-MT2 在通用翻译、真实商业场景、专业领域和指令遵循翻译任务中均表现出色。其中,7B 和 30B 模型在快速思考模式下超越了 DeepSeek-V4-Pro 和 Kimi K2.6 等开源模型,而轻量级的 1.8B 模型也全面超越了 Microsoft、Doubao 等主流商业 API 提供商。

![[未配图]](https://arxiv.org/html/2605.22064v1/logo/hugging.png)https://huggingface.co/collections/tencent/hy-mt2

![[未配图]](https://arxiv.org/html/2605.22064v1/logo/github.png)https://github.com/Tencent-Hunyuan/Hy-MT2

见标题图1:Hy-MT2 模型与最先进基线的基准性能。## 1从 Hy-MT1.5 到 Hy-MT2

Hy-MT1.5 (Zheng 等人, 2025 (https://arxiv.org/html/2605.22064#bib.bib15)) 发布后,引起了开源社区和实际商业应用的广泛关注。随着该模型在更多实际翻译场景中被采用,社区和商业反馈表明,Hy-MT1.5 在领域特定翻译、真实场景翻译、翻译指令遵循以及高效的设备端部署方面仍有改进空间。同时,Hy3-preview 所带来的显著质量提升,进一步激励我们将其作为强大的教师模型来提升 Hy 翻译模型的性能。为了进一步解决这些局限性,我们提出了 Hy-MT2 模型系列。

首先,领域特定和真实场景翻译对 Hy-MT1.5 而言仍然具有挑战性。金融、法律、医学等专业领域包含大量专业术语和既定行业译法,这对翻译的准确性和一致性提出了更高要求。网页、会议、社交内容等真实商业场景则涉及更多样的文本格式和使用需求。为应对这些挑战,Hy-MT2 增强了专业领域和真实应用场景的翻译能力,使模型能更好地适应不同领域、来源和文本形式的翻译需求。

其次,在实际使用中,用户通常会对翻译输出施加额外约束,例如保留某些词不翻译、控制翻译风格或按指定模板输出。在这些场景中,Hy-MT1.5 可能会忽略约束或无法满足指定要求。为此,Hy-MT2 增强了多语言翻译指令的理解和执行能力,使模型能够可靠地遵循不同语言中的用户要求,包括风格、格式及其他翻译约束,如表1 (https://arxiv.org/html/2605.22064#S1.T1) 所示。

此外,社区反馈表明,Hy-MT1.5-7B 与 Gemini 3.1 Pro (DeepMind, 2025 (https://arxiv.org/html/2605.22064#bib.bib1)) 和 GPT-5.5 (OpenAI, 2026 (https://arxiv.org/html/2605.22064#bib.bib10)) 等最强闭源模型之间仍存在明显的翻译质量差距。先前的研究和模型实践表明,扩大模型规模通常有助于提升复杂翻译场景中的理解、表达和指令遵循能力。然而,代表性的规模化翻译模型(如 TransGemma-27B)大多采用密集架构,导致推理成本高昂,不太适合实际服务部署。因此,Hy-MT2 引入了混合专家架构,并发布了 Hy-MT2-30B-A3B,以在翻译质量和推理效率之间取得更好的平衡。

最后,实际业务部署也暴露了 Hy-MT1.5 在设备端效率上的局限。Hy-MT1.5-1.8B 的 4-bit 量化版本仍需超过 1GB 的存储空间,其推理速度在一些低延迟翻译场景中也不足以满足需求。为解决此问题,Hy-MT2 进一步探索了超低位量化,基于混元 AngelSlim 技术实现了 1.25-bit 极端量化。该版本部署仅需约 440MB 存储空间,在 Apple A15 上相比 Hy-MT1.5 的 4-bit 量化版本实现了 1.5 倍的推理加速,显著降低了设备端部署成本,同时提高了推理效率。

总体而言,Hy-MT2 系统性地解决了 Hy-MT1.5 在领域特定翻译、真实场景翻译、翻译指令遵循、与最强闭源模型的性能差距以及高效设备端部署方面的局限性。它建立了一个高质量、高效、多能力的多语言翻译模型系列,更适合实际应用。

表1:Hy-MT2 翻译任务的中英文指令示例。类型中文提示英文提示默认翻译将以下文本翻译为\{target\_lang\},注意只需要输出翻译后的结果,不要额外解释:\{source\_text\}

Translate the following text into\{target\_lang\}\. Note that you shouldonly output the translated result without any additional explanation:\{source\_text\}

术语参考下面的翻译:
\{text\}翻译成\{text\}
\{text\}翻译成\{text\}
\{text\}翻译成\{text\}
将以下文本翻译为\{target\_lang\},注意只需要输出翻译后的结果,不要额外解释:\{source\_text\}

Reference the following translations:
\{text\}translates to\{text\}
\{text\}translates to\{text\}
\{text\}translates to\{text\}Translate the following text into\{target\_lang\}\. Note that you mustONLY output the translated result without any additional explanation:\{source\_text\}

风格请将以下文本翻译为\{\{target\_lang\}\}。
注意翻译的风格要严格符合【\{\{target\_style\}\}】\{\{source\_text\}\}

Please translate the following text into\{\{target\_lang\}\}\. Note that the translation style must strictly conform to \[\{\{target\_style\}\}\]:\{\{source\_text\}\}

个性化【待翻译文本】
\{source\_text\}【翻译任务】
1、\{user\_preferences\}
2、\{user\_preferences\}
3、......
4、将【待翻译文本】翻译为\{target\_lang\}。\[Source Text\]
\{source\_text\}\[Translation Tasks\]
1\.\{user\_preferences\}
2\.\{user\_preferences\}
3\. ...
4\. Translate the \[Source Text\] into\{target\_lang\}\.分隔符请将以下文本准确翻译为\{\{target\_lang\}\}。
你必须在译文中保留等量的分隔符,绝对不可遗漏、转义或翻译该符号,并注意分隔符的位置。\{\{source\_text\}\}

Please accurately translate the following text into\{\{target\_lang\}\}\.
You mustretain the exact same number of delimiters in the translation\. Strictly do not omit, escape, or translate these symbols, and pay close attention to their placement\.\{\{source\_text\}\}

结构化数据 1\# 任务目标
将下方\{\{source\_text\}\}中的\{\{format\_type\}\}格式数据翻译为\{\{target\_lang\}\}。\# 严格约束 1\.\*\*结构锁定\*\*: 绝对保持原有的\{\{format\_type\}\}数据结构、缩进和层级完全不变。 2\.\*\*选择性翻译\*\*: 仅翻译面向用户展示的可见文本内容。 3\.\*\*禁止修改\*\*: \*\*严禁\*\*翻译或更改任何代码标签、键名 (Key)、变量占位符 (如 ‘\{\{var\}\}‘, ‘$\{var\}‘, ‘%s‘, ‘%d‘ 等) 或代码属性。

\# 数据输入 \{\{source\_text\}\}

\#\#\# Task
Translate the user\-facing text within the following\{\{format\_type\}\}data into\{\{target\_lang\}\}\.\#\#\# Strict Rules 1\.\*\*Structure Preservation:\*\*You MUST preserve the original\{\{format\_type\}\}data structure, nesting, hierarchy, and indentation exactly as they are\. 2\.\*\*Selective Translation:\*\*Translate ONLY the visible, user\-facing text content/values\. 3\.\*\*Strict Non\-Translation:\*\*NEVER translate or alter code tags, keys, properties, object names, or variable placeholders\. Leave them exactly in their original English/code form\.

\#\#\# Source Data \{\{source\_text\}\}

结构化数据 2【背景信息】
\{\{background\_text\}\}请结合背景信息将以下文本翻译为\{\{target\_lang\}\}。【待翻译文本】 \{\{source\_text\}\}

\[Background Information\]
\{\{background\_text\}\}Please translate the following text into\{\{target\_lang\}\}, taking the provided background information into consideration\.\[Source Text\] \{\{source\_text\}\}

注:此表展示了中英文的代表性指令模板。更多多语言指令示例请参见第 3.6 节 (https://arxiv.org/html/2605.22064#S3.SS6)。

## 2方法论

本节介绍 Hy-MT2 的总体方法论。Hy-MT2 专为多语言机器翻译设计,遵循分阶段流程,包括:面向 MT 的中期训练(第 2.1 节 (https://arxiv.org/html/2605.22064#S2.SS1))、以语系为中心的后训练(FCPT;第 2.2 节 (https://arxiv.org/html/2605.22064#S2.SS2))和模型量化(第 2.3 节 (https://arxiv.org/html/2605.22064#S2.SS3))。具体来说,我们从通用 Hy 系列预训练模型出发,进行面向 MT 的中期训练以获得具有基础翻译能力的统一模型。然后通过 FCPT 进一步优化模型。如图 2 (https://arxiv.org/html/2605.22064#S2.F2) 所示,FCPT 包含三个关键过程:参考引导的在线策略蒸馏(RG-OPD;第 2.2.1 节 (https://arxiv.org/html/2605.22064#S2.SS2.SSS1))、语系特定 RL 训练(第 2.2.2 节 (https://arxiv.org/html/2605.22064#S2.SS2.SSS2))和跨语系在线策略蒸馏(Cross-family OPD;第 2.2.3 节 (https://arxiv.org/html/2605.22064#S2.SS2.SSS3))。前两个过程围绕语系组织训练,构建多个语系特定的强教师模型;跨语系 OPD 则将这些教师模型的能力迁移到一个统一的学生模型中,同时结合通用指令遵循数据以保留模型在翻译之外遵循指令的能力。

### 2.1面向 MT 的中期训练

见标题图 2:Hy-MT2 以语系为中心的后训练流程。在面向 MT 的中期训练阶段,我们从 Hy 系列预训练模型出发,在约 1T token 的大规模多语言翻译相关数据上继续训练。该阶段旨在加强模型的翻译能力,并为后续的以语系为中心的后训练提供统一基础。

具体来说,训练数据沿两个维度组织:

- •数据格式:我们同时使用多语言单语语料和并行翻译语料,帮助模型捕捉不同语言的 linguistic 特征,并加强跨语言语义映射和源语言-目标语言对齐。
- •场景覆盖:数据涵盖通用翻译、领域特定翻译、真实场景和指令遵循示例,从而提高翻译质量、领域适应性、实际翻译鲁棒性以及遵循翻译相关指令的能力。

此阶段的输出是一个面向 MT 的中期训练模型,作为 FCPT 的统一起点。

### 2.2以语系为中心的后训练

FCPT 不直接混合所有语系的数据,而是将训练划分为多个语系分支,涵盖不同的语言组,例如西欧语系、东亚语系和中东从右到左语系。在每个分支内,我们整合通用翻译数据、领域特定翻译数据、真实商业场景数据和翻译指令遵循数据,以构建语系特定的教师模型。这种以语系为中心的设计使每个教师能够在更一致的语言分布下学习,减少不同语系间的干扰。

#### 2.2.1参考引导的在线策略蒸馏

参考引导的在线策略蒸馏是 FCPT 的第一阶段。在此阶段,我们在每个语系分支上分别进行在线策略蒸馏,旨在获得一个语系特定的翻译策略,能更好地捕捉相应语系的 linguistic 特征和翻译偏好。得到的模型随后作为后续语系特定 RL 训练的更强初始化。

RG-OPD 的核心是构建一个更强的 Chimera 教师模型。与依赖单一教师模型的传统蒸馏方法不同,Chimera111 名称 Chimera 灵感来源于由多种动物组成的神话生物。在我们的设置中,它指通过融合多个参考源构建的教师信号。我们基于 Hy3-Preview 实现 Chimera 教师。教师模型无需训练额外的、大规模专门化的翻译教师模型。对于每个源句子,它融合多个 Hy 系列参考模型生成的候选翻译以及原始数据集标签。尽管并非所有标签都是人工标注的,但它们仍然作为有用的参考信号。通过融合这些多源参考,Chimera 教师提供了更丰富的评分信号,帮助在蒸馏过程中引入更大的多样性,并为在线策略蒸馏构建更强的监督信号。

具体来说,给定源句子 \(x\) 及其参考集 \(\mathcal{R}(x)\)(\(\mathcal{R}(x)\) 由多个候选参考源组成),当前语系分支的学生模型首先根据其当前策略 \(\pi_{\theta}\) 生成一个翻译 \(y\)。然后 Chimera 教师基于多源参考集 \(\mathcal{R}(x)\) 评估学生输出,并产生一个教师策略或目标分布 \(\pi_{T}(\cdot\mid x,\mathcal{R}(x))\)。通过最小化从教师策略到学生策略的前向 KL 散度来优化学生模型。训练目标可写为:

\[\mathcal{L}_{\text{RG-OPD}}=D_{\text{KL}}\left(\pi_{T}(\cdot\mid x,\mathcal{R}(x))\parallel\pi_{\theta}(\cdot\mid x)\right).\](1)

这里,\(\pi_{T}\) 表示由 Chimera 教师构建的蒸馏目标分布,\(\pi_{\theta}\) 表示当前学生模型的输出策略。我们采用前向 KL 散度作为蒸馏目标,使学生模型能以在线方式从 Chimera 教师学习融合后的翻译偏好,并逐步改进其对相应语系的翻译策略。

经过 RG-OPD 后,每个语系分支获得一个语系特定的学生模型,该模型已适应相应语系的翻译偏好和表达模式。这些模型随后用作后续语系特定 RL 训练的初始化。

#### 2.2.2语系特定 RL 训练

在语系特定 RL 训练中,每个语系分支通过组相对策略优化 (GRPO) (Shao 等人, 2024 (https://arxiv.org/html/2605.22064#bib.bib12)) 进一步优化,使用从 RG-OPD 获得的模型作为初始化。为了提供更细粒度且严格的奖励信号,我们引入了一个混合评估系统,结合基于规则的预过滤器和基于 LLM 的多维质量指标 (MQM) 评估器 (Lommel 等人, 2014 (https://arxiv.org/html/2605.22064#bib.bib9); Freitag 等人, 2021 (https://arxiv.org/html/2605.22064#bib.bib3))。

基于规则的预过滤器...

相似文章

tencent/Hy-MT2-7B

Hugging Face Models Trending

腾讯开源了Hy-MT2系列快速思考的多语言翻译模型(1.8B、7B、30B-A3B),支持33种语言,同时提供了用于设备端部署的极端量化方法以及一个新的指令遵循基准IFMTBench。

@FeitengLi: Hy-MT2 新的开源多语言翻译模型 能力可以跟顶尖大模型匹配、支持 33 种语言之间的互译,而且具备灵活的 Instruct 能力,实现了 2-bit 量化不足 500MB 的空间占用 可以很好的跑在端侧 https://modelsc…

X AI KOLs Timeline

Hy-MT2 is a new open-source multilingual translation model from Tencent Hy that supports 33 languages, offers flexible instruction capabilities, and achieves 2-bit quantization under 500MB for on-device deployment.

AngelSlim/Hy-MT1.5-1.8B-1.25bit

Hugging Face Models Trending

腾讯 AngelSlim 团队发布了 Hy-MT1.5-1.8B-1.25bit,这是一款高度压缩的 1.25 位机器翻译模型,支持 33 种语言,体积仅 440MB,可在设备端运行。该模型采用 Sherry 量化算法,实现了世界一流的翻译质量,可与体积大得多的模型相媲美。

MultiSynt/MT:跨越36种语言的万亿标记多平行预训练数据

arXiv cs.CL

本文介绍了MultiSynt/MT,这是一个通过将英语预训练数据翻译成36种语言而创建的万亿标记多语言平行语料库。实验表明,在此翻译数据上训练的大语言模型在更少的标记下实现了与原生数据相当的性能,但仍存在一些评估盲点和文化差距。

Tencent Hy-MT2 现已采用 Apache License 2.0

Reddit r/LocalLLaMA

腾讯的 Hy-MT2 模型已重新授权为 Apache License 2.0,完全开放用于研究、商业使用和修改。该模型的两个变体目前在 Hugging Face 趋势排行榜上分别位列第 1 和第 4。