超越英语的GRPO:非英语与多语言环境中GRPO的大规模研究
摘要
这项大规模研究调查了非英语和多语言环境中的GRPO,发现以母语进行推理训练与英语训练之间差距较小,并显示出强大的跨语言迁移能力,尽管效果取决于模型和语言。
arXiv:2608.13698v1 公告类型:新
摘要:带有可验证奖励的强化学习(RLVR),通常通过群体相对策略优化(GRPO)进行优化,已成为提升预训练语言模型推理能力的核心方法,但当前研究仍主要集中在英语。我们进行了一项大规模实证研究,涵盖多种基础模型、训练语言和不同推理语言奖励下的多语言和非英语GRPO。我们发现,以母语进行推理训练与英语推理训练之间通常只有微小差距。我们进一步观察到强大的跨语言迁移:在一种语言中训练通常能提升在其他多种语言中的表现。然而,具体趋势高度依赖于模型和语言。在某些情况下,以特定语言训练会导致其他语言中域外能力的严重退化。我们的分析表明,超越英语的RLVR可以提供广泛的跨语言收益,但也需要广泛评估以检测特定语言的退化。
查看缓存全文
缓存时间: 2026/08/17 09:42
# GRPO超越英语:大规模研究非英语与多语言环境中的GRPO
来源:https://arxiv.org/html/2608.13698 \\metadata
\[通讯作者\]konstantin\.dobler@hpi\.de
Federico ScozzafavaJonathan JankeMohamed AliSimon Lehnerer
单位:Apple单位:1哈索·普拉特纳研究所 & ELLIS波茨坦分部(实习期间于苹果公司完成工作)
2026年8月13日
###### 摘要
基于可验证奖励的强化学习(RLVR)通常通过群体相对策略优化(GRPO)进行优化,已成为提升预训练语言模型推理能力的核心方法,但现有研究仍严重偏向英语。我们针对广泛的基座模型、训练语言以及不同的推理语言奖励,对多语言和非英语环境下的GRPO进行了大规模实证研究。我们发现,以母语进行推理训练与英语推理训练之间仅存在微小差距。我们进一步观察到强烈的跨语言迁移现象:用一种语言训练通常能提升多种其他语言的表现。然而,特定趋势高度依赖于模型和语言。在某些情况下,用特定语言训练会导致其他语言领域外能力的严重退化。我们的分析表明,超越英语的RLVR可以带来广泛的跨语言增益,但同时也需要广泛的评估来检测特定语言的退化现象。
## 1引言
长链式思维(CoT)推理已成为当代大语言模型(LLM)的核心能力。近期进展的主要驱动力之一是基于可验证奖励的强化学习(RLVR),模型在此过程中探索多样化的解决路径,并使用可自动验证的结果反馈(如精确匹配的数值答案)进行优化。在此设定下,群体相对策略优化(GRPO)已成为一种有效的训练方法。尽管许多开源模型具备多语言预训练,但GRPO/RLVR的后训练研究仍主要局限于英语。最新证据表明,在RLVR下,即使提示词使用其他语言,推理痕迹也可能向主导的预训练语言(通常是英语)漂移。同时,关于测试时控制的研究发现,强制模型使用非英语目标语言进行推理可以提高可解释性和语言忠实性,但通常会以准确性的严重损失为代价。本文研究了多语言和非英语环境下的GRPO训练,并分析了跨语言迁移、推理语言的影响以及多语言训练效果。至关重要的是,我们在三个模型系列上进行了广泛的实验,包括“-Base”基座模型和经过后训练的变体,以及不同规模的模型。我们进行了多语言训练实验以及涵盖11种不同语言和9种不同模型的独立单语训练。如第4节所示,这一大规模研究设置揭示了GRPO的效果可能高度依赖于模型和语言,仅基于单一模型或单一训练语言得出的结论可能具有误导性。总之,我们的贡献包括:
- • 我们对多语言和非英语GRPO进行了大规模对照研究,涵盖9个基座模型、11种训练语言(包括单语和多语言训练设置)以及英语和母语推理奖励。
- • 我们发现,在训练中奖励非英语语言推理与英语推理奖励相比平均仅存在微小差距,并且在GRPO下,大量模型和语言之间会发生显著的跨语言迁移。
- • 我们观察到GRPO在非英语提示或奖励推理语言下存在一种依赖于语言的退化失效模式:特定模型-语言组合可能导致其他未见过的语言或任务出现严重退化,即使在其他地方性能有所提升。
## 2相关工作
一个直接相关的工作方向研究了推理语言如何影响推理模型的性能。推理时的干预措施和多语言推理分析揭示了一种张力:使用用户语言推理对于可读性至关重要,而英语或混合语言推理通常能保持更高的任务准确性。在RLVR过程中也出现类似的张力,推理可能向主导的预训练语言漂移,或者因此使用语言混合和语言一致性目标来引导模型使用所需语言。相反,近期工作将推理语言的多样性视为探索的来源,而不仅仅是控制的失败。这些发现共同推动了我们在统一的GRPO设定下,针对广泛的模型和语言,对英语和母语推理奖励进行的对照比较。第二个方向是将强大的英语推理能力转移到其他语言。现有方法在操作上各不相同——通过翻译、参考痕迹、评判器或教师分布等各种方法——但都使用不同形式的跨语言监督信号来弥合英语和非英语推理之间的差距。相比之下,我们的研究没有引入新的对齐或翻译机制,而是固定GRPO训练方法,系统地改变提示词和奖励的推理语言。近期研究进一步表明,基于RL的后训练可以跨语言迁移改进,包括训练中未包含的语言,并且在某些设定下比监督微调更有效泛化。最相关的是,同样研究了GRPO下的跨语言迁移和推理语言的影响,但重点是比较SFT和GRPO,且训练语言范围较小,仅使用两个基座模型。大多数先前研究要么提出特定的迁移方法,要么评估相对较少的模型或训练语言,而我们的研究覆盖了广泛的模型和语言。我们将在附录C中讨论更广泛的相关工作。
## 3实验设置
#### 数据集。在非英语训练环境中对GRPO进行大规模研究需要大规模的、适合RLVR训练的多语言可用数据集。我们使用了多语言推理健身房,它可以为14种不同语言程序化生成不同难度的“无限”数据样本。GRPO训练对数据与模型能力匹配的问题难度尤为敏感。因此,仅仅翻译英语数据集不一定是最优的,无论数据稀缺与否:模型在不同语言中表现出的能力不同;因此,英语中的“最优”难度在其他语言中可能太难。多语言推理健身房为每个任务提供了难度课程,可以根据当前模型的性能进行调整。具体来说,我们将所有任务初始化为最低难度,并在特定任务的最近32次运行中超过70%正确时增加难度(如果少于10%正确则允许降低难度)。然而,尽管可以调整难度,一些任务即使在最低难度下对小模型来说也过于困难。因此,我们使用Qwen3-14B-Base对所有任务在简单(默认)难度级别进行了初步筛选。我们过滤掉所有Qwen3-14B-Base的pass@8分数为零的任务。此外,我们从每个任务领域(例如算术、图论、逻辑、几何)中采样任务构建了一组保留任务。我们还从训练中排除了所有包含大量英语内容(例如英语应用题)的任务,仅将其用于评估。这最终为我们留下了在主要训练配置中用于训练的62个任务,以及在训练期间未见过的、用于分布外评估的30个任务(见附录A)。
#### 模型。近期研究表明,RL训练性能严重依赖于所使用的基座模型。因此,我们在来自Qwen、Gemma和SmolLM系列的广泛模型上运行实验:Qwen3-Base-{1.7B/4B/8B}、Qwen3-{1.7B/4B/8B}、SmolLM3-3B以及gemma-3-{1b/4b}-it。该设置不仅包括不同的模型系列,还包括处于不同后训练阶段的模型、不同规模的模型(最大达80亿参数)以及预训练时覆盖不同数量语言的模型,总共包含9个不同的基座模型。
#### 训练。我们在每种语言上运行500步RL训练,学习率为1×10⁻⁶,每步64个提示,每个提示进行8次运行(导致每步总批量大小为512)。我们使用DAPO风格的损失公式,不包含KL散度惩罚。遵循标准的RLVR实践,当提取的答案被验证正确时,我们给予二进制正确性奖励。仅在答案正确时,我们才提供最多两个额外奖励,每个权重为正确性奖励的一半:(1)遵循指定输出格式的格式奖励;(2)推理语言奖励,该奖励要么奖励与提示语言匹配(“母语推理”),要么奖励使用英语推理(“英语推理”)。此设置允许跨语言和模型的稳健训练,避免了在初步实验中针对低资源语言观察到的崩溃或过拟合于格式奖励的现象。在本研究中,我们希望研究训练数据语言和推理语言的效果及其相互作用。为了揭示模型和训练语言特有的现象,我们运行了单语训练,涵盖了MGSM中存在的11种不同语言(英语、中文、德语、法语、西班牙语、俄语、日语、泰语、斯瓦希里语、泰卢固语和孟加拉语),以及一个多语言运行,其中样本的语言从该集合中均匀采样。这保留了多语言推理健身房中的三种语言(意大利语、韩语和葡萄牙语)作为完全保留语言。我们为所有训练语言训练了英语奖励变体。对于具有足够初始支持(非英语)目标推理语言的模型-语言对(见第4.1节),我们还训练了一个母语奖励变体。这为每个基座模型产生了多达23个训练变体。更多细节见附录A。
#### 评估。我们在多语言推理健身房的已见任务的未见样本、多语言推理健身房的30个未见任务以及MGSM和PolyMath基准测试上评估所有训练检查点。PolyMath包含四个不同难度级别,其中最低级别与MGSM大致相当。确实,我们看到PolyMath和MGSM低难度划分的表现通常相似,而PolyMath更困难的划分有时显示出截然不同的趋势(见我们在第4.3节的分析)。因此,我们将MGSM和PolyMath的低难度划分为“简单数学”,其余PolyMath划分为“复杂数学”。我们使用所有可用语言评估每个检查点,以研究跨语言迁移效应。所有任务均使用每个提示8次运行,并报告avg@8性能。最大运行长度为16k tokens,并使用推荐的采样参数。更多细节见附录A。
(a)英语推理奖励(b)母语推理奖励
图1:评估期间检测到的推理语言。我们将其分为四个互斥的类别:(1)被奖励的语言,(2)提示语言(如果与奖励语言不同),(3)英语(如果与前两者都不同),以及(4)所有其他语言。结果在所有评估的基准和训练语言上取平均值。
## 4结果
我们首先在第4.1节讨论推理语言的影响,然后在第4.2节讨论跨语言迁移和多语言GRPO训练,最后在第4.3节讨论令人惊讶的特定语言能力退化现象。
### 4.1推理语言的影响
先前工作表明,母语推理会降低推理模型的性能。小规模训练可以可靠地确保推理痕迹的语言一致性,但不能消除性能损失。然而,这些工作在被测试的推理语言中未使用或仅使用了非常小规模的训练。因此,我们研究使用非英语推理语言的大规模RL训练是否可以缩小差距。我们通过奖励塑形来实现这一点:我们比较英语推理奖励与母语奖励,后者奖励使用提示语言进行推理。选择这种方法是为了避免助手劫持等技术带来的干扰。我们区分在RLVR提示中使用的训练语言和生成的推理痕迹中使用的推理语言。评估语言如果在训练期间出现过则为已见语言,否则为未见语言。
#### 推理语言奖励后的语言一致性。在已见评估语言中,两种奖励都强烈控制着推理语言:90.7%来自单语训练英语奖励模型的运行使用英语,而94.9%来自母语奖励模型的运行使用训练语言。在未见语言中,英语奖励模型仍主要使用英语推理……相似文章
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
LC-GRPO:利用朗之万校正弥合基于流的GRPO训练-推理差距
本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。
当英语并非最佳教师:跨语言上下文学习中的源语言效应
本文通过七项任务、六种模型及类型多样的语言,实证研究了上下文学习中的跨语言迁移,表明基于微调的预期并不始终适用,并提出了源语言选择的新启发式方法。
衡量跨语言理解差距:证据语言如何影响语言模型的理解
本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。
小规模语言与视觉语言模型网络代理中GRPO的学习率门控失败:受控零结果及其机制
本文研究了GRPO后训练是否能提升小规模(4B-8B)语言与视觉语言模型网络代理的性能。结果发现了一个受控的零结果:没有任何配置能在已掌握任务上带来可信的提升,且中高学习率会导致性能退化或崩溃,揭示了退化与崩溃状态之间的双重分离。