基于语义奖励的强化学习实现低资源语言扩展而无对齐代价
摘要
本文提出使用基于语义奖励的强化学习(通过GRPO)来将LLM扩展到低资源语言,避免了典型的灾难性遗忘对齐代价,展示了相比监督微调更好的语义质量和迁移性。
arXiv:2605.14366v1 公告类型:新
摘要:将大型语言模型(LLMs)扩展到低资源语言通常会带来“对齐代价”:目标语言的改进以通用能力灾难性遗忘为代价。我们认为这种权衡源于监督微调(SFT)的刚性,它在狭窄且有偏的数据分布上强制执行token级表面模仿。为了解决这一局限,我们提出了一种基于组相对策略优化(GRPO)的语义空间对齐范式,其中模型通过嵌入级别的语义奖励进行优化,而非似然最大化。这一目标通过灵活的表示鼓励意义保存,从而能够进行受控更新,减少对预训练知识的破坏性干扰。我们在藏汉机器翻译和藏语标题生成任务上评估了我们的方法。实验表明,我们的方法在获得低资源能力的同时显著减轻了对齐代价,相比SFT更有效地保持了通用能力。尽管产生的表面重叠不够严格,但语义RL在开放式生成中产生了更高的语义质量和偏好,少样本迁移结果表明它在有限监督下学到了更具迁移性和鲁棒性的表示。总体而言,我们的研究表明,基于语义奖励的强化学习为包容性的低资源语言扩展提供了一条更安全、更可靠的途径。
查看缓存全文
缓存时间: 2026/05/15 06:21
# 基于语义奖励的强化学习实现低资源语言扩展且无对齐税
**来源**: https://arxiv.org/html/2605.14366
Zeli Su¹,²\*、Ziyin Zhang³\*、Zhou Liu⁵\*、Xuexian Song⁶、Zhankai Xu²、Longfei Zheng²、Xiaolu Zhang²、Rong Fu⁴、Guixian Xu¹,⁷†、Wentao Zhang⁵†
¹中央民族大学、²蚂蚁集团、³上海交通大学、⁴澳门大学、⁵北京大学、⁶中国科学院自动化研究所、⁷海南国际学院,中央民族大学
{rickamorty, guixian_xu}@muc.edu.cn
[email protected]、[email protected]、[email protected]
{xuzhankai.xzk, zlf206411}@antgroup.com、[email protected]
[email protected]、[email protected]
###### 摘要
将大语言模型(LLM)扩展到低资源语言时,常常会引发“对齐税”:目标语言能力的提升以通用能力灾难性遗忘为代价。我们认为,这种权衡源于监督微调(SFT)的僵化性,它强制在狭窄且有偏的数据分布上进行词元级表面模仿。为解决这一局限,我们提出了一种基于**群体相对策略优化(GRPO)**的语义空间对齐范式,其中模型通过**嵌入级语义奖励**而非似然最大化进行优化。此目标通过灵活的实现方式鼓励语义保持,从而实现受控更新,减少对预训练知识的破坏性干扰。我们在藏汉机器翻译和藏语标题生成任务上评估了该方法。实验表明,我们的方法在获取低资源能力的同时,显著缓解了对齐税,比SFT更有效地保持了通用能力。尽管产生的表面重叠较少,但语义RL在开放生成中产生了更高的语义质量和偏好,且少样本迁移结果表明,它在有限监督下学到了更具可迁移性和鲁棒性的表示。总体而言,我们的研究表明,基于语义奖励的强化学习为包容性的低资源语言扩展提供了一条更安全、更可靠的路径。
**基于语义奖励的强化学习实现低资源语言扩展且无对齐税**
参见图注
**图1:低资源语言扩展中的词元级对齐与语义空间对齐。** 词元级监督微调在教师强制下强制表面形式模仿,常导致灾难性遗忘和高对齐税。而语义空间对齐通过受约束的强化学习策略更新优化语义保持,允许灵活的实现方式,同时保留预训练知识。
## 1 引言
大语言模型通过大规模预训练和后期对齐,在广泛的任务和语言上取得了显著性能(DeepSeek-AI等,2025(https://arxiv.org/html/2605.14366#bib.bib24);Yang等,2025(https://arxiv.org/html/2605.14366#bib.bib25);Team等,2025(https://arxiv.org/html/2605.14366#bib.bib26);OpenAI,2025(https://arxiv.org/html/2605.14366#bib.bib27);Comanici等,2025(https://arxiv.org/html/2605.14366#bib.bib28))。然而,其能力在不同语言上极不均匀:许多语言支持薄弱,尤其是在需要语义抽象而非表面模式匹配的生成和推理密集型任务上。因此,在这种低资源语言环境下提升模型性能仍是一个重要且具有挑战性的问题。
提升低资源语言性能的常见方法是使用语言特定数据进行进一步训练,包括持续预训练和监督指令微调。尽管数据来源和训练协议有所不同,这些方法共享一个共同的优化范式:它们依赖教师强制学习,使用词元级似然目标,通过表面形式模仿将模型与目标数据分布对齐。图1(https://arxiv.org/html/2605.14366#S0.F1)展示了通过表面形式模仿的词元级对齐与基于语义保持的语义空间对齐之间的对比,突出了不同目标在数据稀缺下如何导致根本不同的更新行为。
近期许多关于语言扩展和适应的工作都遵循这一范式,使用监督或弱监督微调将新的语言能力注入预训练模型(language-adaption1;language-adaption3)。基于持续预训练或语言特定模型构建的相关工作也在有限且领域受限的数据上执行强分布级更新(language-adaption2;language-adaption4)。虽然在数据丰富且多样化的监督下有效,但词元级分布匹配在低资源语言环境下会变得问题重重。可用的训练数据通常规模小、领域窄、分布有偏。在此类数据上优化似然会鼓励过于自信和僵化的参数更新,放大过拟合并干扰预训练期间学到的表示。经验上,这种干扰常表现为灾难性遗忘:目标语言能力的提升伴随着现有高资源语言能力的下降,这一现象在多语言微调和低资源表示学习设置中已被系统性地观察到(Liu和Niehues,2025(https://arxiv.org/html/2605.14366#bib.bib29);Schmidt,2025(https://arxiv.org/html/2605.14366#bib.bib31))。
我们认为,这种现象不仅仅是优化过程中的附带产物,而是对齐目标本身的结构性结果。当对齐等同于狭窄分布上的表面形式模仿时,表示能力被激进地重新分配,导致*对齐税*:以牺牲通用能力为代价换取低资源语言性能的提升。只要目标强制在稀疏数据上进行词元级匹配,无论采用何种适应方法(如持续预训练或指令微调),该问题都会持续存在(Yamaguchi等,2025(https://arxiv.org/html/2605.14366#bib.bib30))。因此,我们提议转变视角,将语言扩展不仅视为适应,更多的是看作一种*稀疏监督下的对齐问题*。
为解决这一问题,我们引入了一种语义空间对齐范式,优先考虑语义保持而非僵化的表面形式模仿。我们使用**群体相对策略优化(GRPO)**(Shao等,2024(https://arxiv.org/html/2605.14366#bib.bib14))来实现该框架,采用**嵌入级语义相似度**作为主要奖励信号。与教师强制训练不同,该方法鼓励模型探索保持语义等价的各种语言实现。关键是,通过基于采样组内的相对奖励进行优化,我们的方法天然融合了信任区域优化的稳定性约束(Schulman等,2017(https://arxiv.org/html/2605.14366#bib.bib12);Rafailov等,2023(https://arxiv.org/html/2605.14366#bib.bib13)),从而能够在获取低资源能力的同时严格限制典型无约束似然最大化所带来的破坏性干扰。
我们在藏汉机器翻译(MT)和藏语标题生成(HG)任务上评估了我们的方法。实验结果表明,基于语义奖励的GRPO在适应与保持之间取得了优越的权衡。在MT任务中,我们的方法显著降低了对齐税,在主导语言CMRC基准上比强SFT基线高出+5.15分。类似地,在HG任务中,尽管n-gram重叠度较低,我们的模型被基于LLM的评判者更偏好,胜率比SFT高+16.1%。这些发现表明,语义空间对齐为在数据稀缺下提升低资源语言性能提供了一种更安全、更稳健的范式。
总结而言,本文的主要贡献如下:
- • 我们提出了一种**语义空间对齐范式**,利用带嵌入级奖励的群体相对策略优化(GRPO)将语义保持与表面形式模仿解耦。
- • 我们证明该方法几乎消除了**对齐税**,在保持模型通用能力和预训练知识的同时实现了显著的低资源性能提升。
- • 我们表明,我们的方法生成了**语义更优的输出**,尽管与严格参考的n-gram重叠度较低,但仍比SFT基线更受LLM评判者偏好。
- • 我们验证了语义RL产生了**更具可迁移性的表示**,与监督方法相比,在下游任务上展现出更强的少样本泛化能力。
## 2 相关工作
### 2.1 低资源语言适应与扩展
训练后的语言扩展与适应通常从一个预训练的基础模型开始,并在语言特定数据上进一步训练。先前的工作研究了监督微调或指令微调以迁移语言能力并随数据和模型规模扩展(language-adaption1;language-adaption3),以及强调语料库选择和组成的持续预训练和语言特定模型构建(language-adaption2;language-adaption4)。在这些设置中,对狭窄分布的选择性适应可能引发灾难性遗忘,降低非目标语言或任务上的性能(Liu和Niehues,2025(https://arxiv.org/html/2605.14366#bib.bib29);Schmidt,2025(https://arxiv.org/html/2605.14366#bib.bib31))。一些缓解策略侧重于约束更新幅度或保护先前学到的能力,例如参数高效微调(如LoRA风格的低秩更新)和源保护适应(Yang等,2025(https://arxiv.org/html/2605.14366#bib.bib32);Yamaguchi等,2025(https://arxiv.org/html/2605.14366#bib.bib30))。虽然这些方法可以减少干扰,但它们通常保留教师强制的词元级似然目标。我们的工作是补充性的:我们重新考虑对齐目标本身,通过嵌入级奖励优化语义一致性,旨在以更低的对齐税提升弱语言能力。
### 2.2 LLM对齐的强化学习
强化学习通常用于LLM对齐,当优化目标是序列级或不可微分时,它能够超越词元级监督模仿进行学习(Christiano等,2017(https://arxiv.org/html/2605.14366#bib.bib7);Ouyang等,2022(https://arxiv.org/html/2605.14366#bib.bib10))。基于RL的对齐方法的一个核心优势是使用受约束的策略更新,例如信任区域或KL正则化优化,这限制了与预训练表示的偏离并提升了稳定性(Schulman等,2015(https://arxiv.org/html/2605.14366#bib.bib11),2017(https://arxiv.org/html/2605.14366#bib.bib12))。最近的变体在保持约束更新原理的同时提高了效率或灵活性,包括直接偏好优化(Rafailov等,2023(https://arxiv.org/html/2605.14366#bib.bib13))和基于群体的策略优化方法(Shao等,2024(https://arxiv.org/html/2605.14366#bib.bib14)),我们在本文中采用这些方法以实现向语义级目标的受控对齐。
## 3 方法
### 3.1 问题形式化:语义空间对齐
我们将低资源语言扩展视为一个对齐问题。给定一个预训练的指令遵循语言模型π_base,我们的目标是获取低资源语言的新能力,同时保持主导高资源语言中现有能力。传统的监督微调通过最大化目标数据分布下的词元级似然来对齐模型。在分布狭窄且有偏的低资源环境中,该目标强制表面形式模仿,常导致过于自信的更新和灾难性遗忘。我们转而将对齐定义为**语义空间对齐**:只要模型输出保持语义,无论其具体表面实现如何,都被视为正确。此形式化明确地将语义充分性与词元级匹配解耦,并允许同一意图有多种有效表达。在这种视角下,对齐由语义一致性定义,而非分布匹配。因此,我们的目标是优化模型,使其产生与参考文本语义等价的输出,同时限制对预训练期间所学表示的干扰。
### 3.2 两阶段训练范式
为了在低资源环境中实现语义空间对齐,我们采用两阶段训练范式。
##### 阶段1:冷启动监督微调。
我们首先在少量低资源数据子集上执行轻量级的监督微调步骤,以获得初始策略π_init。具体地,我们在5k训练实例上微调基础模型两个epoch。此阶段的目标不是实现强任务性能,而是在目标语言中引导出最小输出能力,例如生成正确文字和保持基本语言一致性。这种冷启动初始化使模型能够可靠地生成非退化的低资源语言输出,确保后续语义奖励有意义,并且强化学习不会坍缩为无信息探索。
##### 阶段2:基于语义奖励的强化学习。
从π_init出发,我们执行强化学习以在语义空间中对齐模型。在此阶段,我们利用剩余训练数据,通过语义奖励(而非词元级监督)驱动学习。强化学习执行一个epoch,期间鼓励模型探索多样化的表面实现,同时保持与参考文本的语义等价。整个训练过程应用受约束策略优化以控制更新幅度,使模型能够获取低资源语言能力,同时最小化对预训练表示的破坏性干扰。
### 3.3 语义对齐的强化学习
优化语义对齐本质上是离散输出上的序列级问题。我们框架中使用的基于嵌入的语义奖励相对于模型参数不可微分,因此标准监督学习目标不适用。强化学习因此为优化此类不可微分的序列级目标提供了自然且原则性的框架,允许直接优化语义一致性而非词元级似然。除了能够优化语义奖励外,强化学习在低资源适应过程中保留预训练知识方面也发挥着关键作用。与在狭窄数据分布上执行无约束似然最大化的监督微调相比,受约束的强化学习方法明确限制策略更新。这种受控优化对于减少破坏性干扰和缓解灾难性遗忘至关重要,使得强化学习特别适用于数据稀缺下的语义空间对齐。相似文章
基于语义级奖励的LLM校准
提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。
当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。
超越 GRPO 与策略内蒸馏:语言模型后训练的经验性“稀疏至稠密”奖励原则
本文提出了一种用于语言模型后训练的经验性“稀疏至稠密”奖励原则,主张应使用稀疏奖励配合稀缺的标注数据进行教师模型发现,并使用稠密奖励通过蒸馏进行学生模型压缩。作者证明,这种连接稀疏强化学习与策略内蒸馏的分阶段方法,在数学基准测试中优于在部署规模模型上直接运行 GRPO 的效果。
DACA-GRPO:扩散语言模型中强化学习的去噪感知信用分配
本文指出了现有扩散语言模型强化学习方法中的弱点——缺乏时间信用分配和偏差似然估计——并提出了DACA-GRPO,一种即插即用的增强方案,引入了去噪进度分数和分层掩码似然,在推理、代码生成和受约束生成等多个基准上取得了一致的改进。
通过一致性驱动的强化学习提升跨语言事实召回
本文介绍了PolyFact,一个大规模多语言事实问答数据集,并展示了通过GRPO的强化学习相比监督微调能显著提升LLM的跨语言事实一致性,通过重组多语言表示。