面向多语言机器翻译的开放大型语言模型无参考后训练

arXiv cs.CL 论文

摘要

本文来自小米,介绍了面向多语言机器翻译的无参考后训练,将带有质量评估奖励的GRPO应用于MiLMMT-46-v0.1 SFT模型,生成MiLMMT-46-v1.0,该模型提升了46种语言的翻译质量,并超越了开放和专有基线。

arXiv:2608.10812v1 公告类型:新 摘要:我们研究了使用开放大型语言模型进行多语言机器翻译的无参考后训练。从监督微调的MiLMMT-46-v0.1模型开始,我们应用组相对策略优化(GRPO),其奖励平均两个无参考质量评估模型,并通过语言识别进行门控。然后,我们线性插值监督微调(SFT)和强化学习(RL)模型检查点,以获得MiLMMT-46-v1.0。在46种语言中,所得模型在翻译质量上持续优于其SFT对应模型,超越了近期强大的开放基线(包括Seed-X、HY-MT2和TranslateGemma),并在与Google Translate、Gemini 3 Pro和GPT-5等评估的专有系统的对比中取得了领先的无参考分数。我们进一步研究了在策略蒸馏,发现它达到了但未超过通过RL与检查点插值所达到的质量前沿。我们发布了模型和代码以促进未来的研究。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:38

# 开放大型语言模型的无参考后训练用于多语言机器翻译
来源:https://arxiv.org/html/2608.10812
Chris Han, Pengzhi Gao, Pei Fu, Jian Luan 小米公司,北京,中国

###### 摘要

我们研究了开放大型语言模型在无参考后训练下的多语言机器翻译。从监督微调的 MiLMMT-46-v0.1 模型Shang et al. (2026 (https://arxiv.org/html/2608.10812#bib.bib5))开始,我们应用群体相对策略优化 (GRPO)Shao et al. (2024 (https://arxiv.org/html/2608.10812#bib.bib4)),其奖励基于两个无参考质量评估模型的平均值,并通过语言识别进行门控。然后我们线性插值监督微调 (SFT) 和强化学习 (RL) 模型检查点,得到 MiLMMT-46-v1.0。在 46 种语言上,所得模型在翻译质量上持续优于其 SFT 对应版本,超过包括 Seed-XCheng et al. (2025 (https://arxiv.org/html/2608.10812#bib.bib14))、HY-MT2Zheng et al. (2026 (https://arxiv.org/html/2608.10812#bib.bib17)) 和 TranslateGemmaFinkelstein et al. (2026 (https://arxiv.org/html/2608.10812#bib.bib18)) 在内的近期强开放基线,并在评估的专有系统(如 Google Translate、Gemini 3 Pro 和 GPT-5)中取得领先的无参考分数。我们进一步研究了同策略蒸馏,发现它可以达到但未超过通过 RL 加检查点插值所获得的质量前沿。我们发布模型和代码以促进未来研究。¹¹模型发布在https://huggingface.co/collections/xiaomi-research/milmmt-46。代码发布在https://github.com/xiaomi-research/gemmax。

# 开放大型语言模型的无参考后训练用于多语言机器翻译

Chris Han, Pengzhi Gao††footnote:通讯作者:[email protected], Pei Fu, Jian Luan小米公司,北京,中国

## 1 引言

开放大型语言模型 (LLM),包括 Gemma 和 Qwen 系列Gemma Team (2026 (https://arxiv.org/html/2608.10812#bib.bib2)); Qwen Team (2025 (https://arxiv.org/html/2608.10812#bib.bib3)),最近已成为多语言机器翻译 (MT) 的强大基础。通过持续预训练和监督微调 (SFT),近期工作已将这些模型改造为能力较强的多语言翻译系统。特别是,MiLMMT-46-v0.1 模型Shang et al. (2026 (https://arxiv.org/html/2608.10812#bib.bib5))在 46 种语言上取得了强劲性能,为进一步后训练提供了良好的开放起点。

尽管取得了这些进步,通过监督学习进一步改进多语言 MT 仍受限于高质量平行数据的稀缺和不均匀覆盖,尤其是在低资源语言和非英语中心翻译方向上。相比之下,源端文本要丰富得多,并且更容易跨语言收集。这一差距推动了无参考后训练方法的发展,这些方法可以利用源端数据而不需要对齐的目标句子。

强化学习 (RL) 为该场景提供了自然框架,因为它可以优化模型生成翻译的序列级奖励,而不是针对参考的标记级似然。群体相对策略优化 (GRPO)Shao et al. (2024 (https://arxiv.org/html/2608.10812#bib.bib4))最近已被应用于多语言翻译,并带有精心设计的奖励,例如 Tower+Rei et al. (2025 (https://arxiv.org/html/2608.10812#bib.bib12)) 和 HY-MT2Zheng et al. (2026 (https://arxiv.org/html/2608.10812#bib.bib17))。无参考质量评估 (QE) 模型可以在没有参考的情况下对源句子及其候选翻译进行评分,但不完美的评估器可能会鼓励奖励攻击Liu et al. (2026 (https://arxiv.org/html/2608.10812#bib.bib20))。语言识别门控可以抑制错误语言输出,而 SFT-RL 检查点插值可以减轻奖励诱导的漂移并保留 SFT 期间学到的行为。这些考虑促使我们将无参考 RL 与检查点插值相结合。

基于 MiLMMT-46-v0.1 模型,我们研究了在三种模型规模和 46 种语言上的这种方法。我们的实验表明,无参考 RL 在学习的质量指标上持续优于 SFT,并与近期强开放和专有系统相比表现优异,而检查点插值在无参考质量和基于参考的性能之间提供了可控的权衡。我们进一步研究了同策略蒸馏 (OPD)Agarwal et al. (2024 (https://arxiv.org/html/2608.10812#bib.bib27)); Lu and Lab (2025 (https://arxiv.org/html/2608.10812#bib.bib26))作为替代后训练方法,发现它可以达到但未超过通过 RL 加检查点插值获得的质量前沿。我们发布所得的 MiLMMT-46-v1.0 模型和代码,以促进未来研究。

## 2 方法

从监督微调的 MiLMMT-46-v0.1 模型开始,我们使用群体相对策略优化 (GRPO) 来优化基于两个质量评估模型和语言识别门控的无参考奖励。然后我们线性插值 SFT 和 RL 检查点,以保留监督微调期间学到的行为,同时融入 RL 的改进。

#### 训练目标。

我们在 RL 阶段采用 GRPO。对于每个源句子x,我们从旧策略πθold中采样一组G个候选翻译{y1,...,yG}。设Ri表示分配给候选翻译yi的奖励,设πref表示固定的 SFT 参考策略。我们最大化以下目标:

J(θ)=Ex,{yi}[1G∑i=1G1|yi|∑t=1|yi|{min[ri,tA^i,t,clip(ri,t,1−ε,1+ε)A^i,t]−βDKL(πθ∥πref)}],

其中

ri,t(θ)=πθ(yi,t∣x,yi,<t)πθold(yi,t∣x,yi,<t)

是 token 级重要性比率,A^i,t是从采样翻译的奖励{Ri}i=1G计算得到的组归一化优势,ε控制裁剪范围,β控制将 RL 策略向 SFT 参考策略正则化的 Kullback-Leibler (KL) 惩罚。

#### 奖励设计。

给定源句子x、候选翻译y和预期目标语言ℓ,我们使用 OpenLID-v3Fedorova et al. (2026 (https://arxiv.org/html/2608.10812#bib.bib22))预测y的语言,记为ℓ^(y)。设sX和sK分别表示由 XCOMET²²https://huggingface.co/Unbabel/XCOMET-XXLGuerreiro et al. (2024 (https://arxiv.org/html/2608.10812#bib.bib8))和 COMETKiwi³³https://huggingface.co/Unbabel/wmt23-cometkiwi-da-xxlRei et al. (2023 (https://arxiv.org/html/2608.10812#bib.bib9))分配给(x,y)的分数。我们定义奖励为

R(x,y,ℓ)={12(sX+sK),ℓ^(y)=ℓ,0,其他情况。

该语言识别门控可防止流畅但错误语言的输出获得高 QE 奖励,从而缓解一种已知的奖励攻击形式Liu et al. (2026 (https://arxiv.org/html/2608.10812#bib.bib20))。

#### RL 数据。

我们从 MiLMMT SFT 数据中推导出 RL 数据集,保留每个示例的源句子和翻译方向,同时丢弃其参考翻译。这产生了 263982 个实例,涵盖 192 个翻译方向。由于 GRPO 依赖组内奖励差异,奖励几乎相同的 rollout 组提供的训练信号很少。因此,我们使用 RL rollout 配置为每个实例采样G个翻译,用我们的奖励函数对其进行评分,并保留组均值μx和标准差σx满足0.30<μx<0.95和σx≥0.05的实例。均值边界移除平均奖励极低或极高的实例,而标准差阈值移除奖励变化很小的组。这留下 31572 个实例,随机分为 30572 个训练和 1000 个验证实例。按翻译方向的详细细分见附录A (https://arxiv.org/html/2608.10812#A1)。

#### SFT-RL 检查点插值。

设θSFT表示 MiLMMT-46-v0.1 的参数,θRL表示 RL 后获得的参数。为了在保留 RL 收益的同时减少奖励诱导的漂移,我们线性插值两个检查点:

θα=αθSFT+(1−α)θRL,α∈[0,1]。

这里,α控制 SFT 检查点的贡献,而1−α控制 RL 检查点的贡献。插值不需要额外训练。我们将θRL称为 MiLMMT-46-v0.1-RL,将选定的插值检查点称为 MiLMMT-46-v1.0。

## 3 实验设置

#### 数据集。

我们在涵盖广泛语言谱系的 46 种语言上进行了实验,详细语言信息总结在表4 (https://arxiv.org/html/2608.10812#A2.T4)中。我们在 FLORES+LLB Team et al. (2024 (https://arxiv.org/html/2608.10812#bib.bib6))和 WMT24++Deutsch et al. (2025 (https://arxiv.org/html/2608.10812#bib.bib7))基准上评估多语言翻译性能。对于 WMT24++,我们采用英语源句子,并排除那些被标记为低质量、不适于无参考评估的句子。

#### 基线。

我们与强专有系统进行比较,包括 Google Translate、Gemini 2.5/3 Pro 和 GPT-5,以及大规模多语言 NMT 模型 NLLBTeam et al. (2022 (https://arxiv.org/html/2608.10812#bib.bib21))。此外,我们还与几个强开源多语言翻译模型进行比较:

- •Tower-PlusRei et al. (2025 (https://arxiv.org/html/2608.10812#bib.bib12)):基于 Gemma2/Qwen2.5 的模型,用于 27 种语言的多语言翻译和通用任务。
- •GemmaX2-28Cui et al. (2025 (https://arxiv.org/html/2608.10812#bib.bib13)):基于 Gemma2 的模型,专为 28 种语言的多语言机器翻译设计。
- •Seed-X-Instruct/PPOCheng et al. (2025 (https://arxiv.org/html/2608.10812#bib.bib14)):基于 Mistral 的模型,通过指令微调和强化学习训练用于 28 种语言的多语言机器翻译。
- •Hunyuan-MT、HY-MT1.5 和 HY-MT2Zheng et al. (2025b (https://arxiv.org/html/2608.10812#bib.bib15),a (https://arxiv.org/html/2608.10812#bib.bib16),2026 (https://arxiv.org/html/2608.10812#bib.bib17)):基于 Hunyuan 的多语言翻译模型,覆盖 33 种语言。
- •TranslateGemmaFinkelstein et al. (2026 (https://arxiv.org/html/2608.10812#bib.bib18)):基于 Gemma3 的模型,用于 55 种语言的高质量翻译。

#### 训练和检查点插值配置。

我们在所有三种规模(1B、4B 和 12B)上应用相同的 RL 方案,使用verl⁴⁴https://github.com/verl-project/verl框架Sheng et al. (2025 (https://arxiv.org/html/2608.10812#bib.bib24)),并采用基于 vLLM 的Kwon et al. (2023 (https://arxiv.org/html/2608.10812#bib.bib23))rollout。对于每个 RL 实例,我们采样G=8个候选,并用低方差 KL 惩罚将策略向 SFT 参考πref正则化。RL 训练后,我们插值 SFT 和 RL 参数以构建最终检查点。对于 MiLMMT-46-v1.0 模型,我们在所有三种规模上设置插值系数α=0.5。我们在插值分析中探索α的其他值。完整超参数列表见附录C (https://arxiv.org/html/2608.10812#A3)。

#### 评估。

我们在 FLORES+ 和 WMT24++ 基准上使用 XCOMET 和 COMETKiwi 作为无参考评估器。两者都是 10B 参数模型,与人类判断具有高相关性Freitag et al. (2023 (https://arxiv.org/html/2608.10812#bib.bib10))。在 FLORES+ 上,我们额外报告基于参考的 spBLEU 和 XCOMET 分数。对于每个基线,我们评估与我们的 46 种语言模型共享的语言子集。翻译使用贪心解码生成。

表 1:WMT24++ 和 FLORES+ 上的翻译性能。WMT24++ QE 单元格报告无参考 XCOMET / COMETKiwi。对于 FLORES+,Ref. 单元格报告 spBLEU / 基于参考的 XCOMET,而 QE 单元格报告无参考 XCOMET / COMETKiwi。每个语言覆盖块内每个指标的最佳和第二佳分数分别以粗体和下划线显示。详细的无参考和基于参考的结果分别见附录D.1 (https://arxiv.org/html/2608.10812#A4.SS1)和附录D.2 (https://arxiv.org/html/2608.10812#A4.SS2)。

## 4 实验结果

### 4.1 主要结果

表1 (https://arxiv.org/html/2608.10812#S3.T1)报告了 WMT24++ 上的无参考结果以及 FLORES+ 上的无参考和基于参考的结果。由于比较的系统在语言覆盖范围上有所不同,每个块使用其包含系统共享的语言子集。

#### 无参考后训练的效果。

在完整 46 语言块中,MiLMMT-46-v1.0 在所有三种模型规模上持续优于其监督微调的 MiLMMT-46-v0.1 对应版本。在三种模型规模上取平均,WMT24++ 上的 XCOMET 和 COMETKiwi 分数分别提高 2.75 和 2.44 分。在 FLORES+ 上,在四个方向组和三种模型规模上取平均,基于参考的 XCOMET、无参考 XCOMET 和 COMETKiwi 分别提高 1.17、1.41 和 1.17 分,而 spBLEU 下降 1.21 分。这些结果表明,无参考后训练持续改进学习的质量指标,但词汇重叠略有减少。由于 spBLEU 衡量与单个参考翻译的词汇重叠,并可能惩罚有效的替代措辞,我们认为其适度下降不如学习质量指标的一致增益具有信息量。

#### 完整 46 语言比较。

MiLMMT-46-12B-v1.0 在 WMT24++ 和所有四个 FLORES+ 方向组上取得了最高的无参考 XCOMET 和 COMETKiwi 分数,优于所评估的专有系统,包括 Google Translate、Gemini 2.5/3 Pro 和 GPT-5。在基于参考的 XCOMET 上,它在四个 FLORES+ 方向组中的三个组中排名前两位。在较小模型中,MiLMMT-46-1B-v1.0 在报告的所有 WMT24++ 和 FLORES+ 指标上均优于 TranslateGemma-4B,尽管参数仅为后者的四分之一。虽然其 spBLEU 仍低于 Google Translate 和 Gemini 2.5/3 Pro,但 MiLMMT-46-12B-v1.0 在四个 FLORES+ 方向组中的三个组中超过了 GPT-5,并在第四个组中达到可比性能。

相似文章

面向MT的无参考强化学习微调:Seq2Seq视角

arXiv cs.CL

本文将组相对策略优化(GRPO)应用于编码器-解码器Seq2Seq模型,用于机器翻译微调,使用无需并行数据的无参考奖励(LaBSE和COMET-Kiwi),并在13种语言上取得了一致的改进。