缓解英语到罗马尼亚语机器翻译中的性别偏见

arXiv cs.CL 论文

摘要

本文提出了一种混合流水线,将基于微调LLaMA的性别分类与标签感知的神经机器翻译相结合,以缓解英语到罗马尼亚语机器翻译中的性别偏见,引入了新数据集,并在基准测试上将性别准确率提高了40多个百分点。

arXiv:2608.08606v1 公告类型:新 摘要:机器翻译(MT)系统通常无法正确翻译性别,尤其是在从英语等性别中性语言翻译到罗马尼亚语等性别化目标语言时。这种偏见导致翻译默认采用阳性形式或强化性别刻板印象。我们提出了一种混合流水线,通过将基于大型语言模型(LLM)的性别分类与神经机器翻译(NMT)相结合来缓解这一问题。我们的系统使用微调后的LLM来检测英语句子中目标词的预期性别,并插入内联性别提示标签。然后,这些带标签的句子被传递给经过微调的Transformer模型,以生成形态学上正确的罗马尼亚语翻译。为此,我们引入了三个用于性别消歧和翻译的新数据集。我们的方法在WinoMT和WinoGender基准测试上的性别准确率相比基线MT系统提高了40多个百分点。这是首个使用LLM推理和标签感知翻译来明确解决和评估英语-罗马尼亚语MT中性别偏见的方法。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:08

# 缓解英语到罗马尼亚语机器翻译中的性别偏见

来源:https://arxiv.org/html/2608.08606  
1 布加勒斯特大学数学与计算机科学学院人类语言技术研究中心  
1 邮箱:[email protected], [email protected]

###### 摘要

机器翻译(MT)系统经常无法正确翻译性别,尤其是在从英语这类性别中立的语言转换到罗马尼亚语这类需要显式语法性别一致的目标语言时。这种偏见会导致译文默认使用阳性形式,或强化性别刻板印象。我们提出一种混合流水线,将基于大语言模型(LLM)的性别分类与神经机器翻译(NMT)相结合,以缓解这一问题。我们的系统使用微调后的 LLM 检测英语句子中目标词的预期性别,并插入行内性别提示标签(例如 `<m>teacher</m>`)。随后,这些带有标签的句子被送入一个经过微调的 Transformer 模型,生成形态正确的罗马尼亚语译文。为此,我们引入了三个用于性别消歧和翻译的新数据集。与基线 MT 系统相比,我们的方法在 WinoMT 和 WinoGender 基准上的性别准确率提升了超过 40 个百分点。这是首个同时利用 LLM 推理和标签感知翻译来显式解决并评估英语–罗马尼亚语 MT 中性别偏见的方法。

## 1 引言

机器翻译(MT)中的性别偏见仍然是一个被充分记录的问题,尤其是在从英语(性别通常是隐含的)翻译到罗马尼亚语(要求显式的语法性别一致)等目标语言时。大多数神经 MT 系统倾向于默认使用阳性形式,或者无法从上下文中正确消解性别,从而产生带有偏见或语法不正确的输出。这一问题在涉及职业、角色或指代人的命名实体的翻译中尤为突出。

在这项工作中,我们引入了新数据集和一种混合流水线,将基于大语言模型(LLM)的性别推断与微调的神经机器翻译(NMT)模型相结合。具体来说,我们使用微调的 LLaMA 模型对英语句子中目标词的性别进行分类,并插入显式的行内性别提示标签。随后训练一个 Transformer 模型来识别并响应这些标签,生成性别感知的罗马尼亚语译文。为支持该系统,我们发布了[1]新颖的高质量语料库,用于(i)性别感知的英语分类和(ii)性别受控的英译罗翻译。我们在多个测试套件上评估了我们的方法,包括 WinoMT 和 WinoGender(见 [11](https://arxiv.org/html/2608.08606#bib.bib2)、[16](https://arxiv.org/html/2608.08606#bib.bib1)),相比基线 MT 在性别翻译准确率上取得了显著提升。我们的结果表明,将基于 LLM 的上下文理解与针对性的 NMT 适应相结合,可以在低资源语言对中缓解性别偏见。直接使用 LLM 进行翻译仍然成本高昂且难以大规模控制;而我们的流水线提供了显式的可控性、可解释性,并兼容现有 MT 系统。

[1]: 所有数据以 CC BY-NC 4.0 许可证发布在 https://github.com/Ioannnnna/EnRoGend

## 2 相关工作

机器翻译(MT)中的性别偏见已有文献记录,尤其是在源语言(如英语)缺乏显式性别标记、而目标语言(如德语、法语、西班牙语)要求语法性别一致的语言对中。早期研究([11](https://arxiv.org/html/2608.08606#bib.bib2)、[16](https://arxiv.org/html/2608.08606#bib.bib1))引入了 WinoGender 和 WinoMT 等诊断数据集,以系统评估翻译中的性别偏见。

近期关于性别包容性机器翻译的研究表明,最先进的 MT 系统和 LLM 仍然默认使用阳性形式,尤其是在形态性别语言中,即使性别中立或性别歧义的翻译更为合适([1](https://arxiv.org/html/2608.08606#bib.bib13)、[14](https://arxiv.org/html/2608.08606#bib.bib12))。新引入的多语言基准和评估数据集显示,模型难以利用上下文线索、扩展话语和显式指令来可靠地生成包容性或中立形式([9](https://arxiv.org/html/2608.08606#bib.bib14))。跨语言分析进一步强调了性别歧义和非二元结构方面的持续困难,促使研究者采用在翻译之前或翻译过程中显式检测和控制性别相关信息的方法([2](https://arxiv.org/html/2608.08606#bib.bib15))。相关工作还探索了句子级源端性别标签,即将说话者的性别作为显式信号提供给翻译模型([19](https://arxiv.org/html/2608.08606#bib.bib19))。

近年来,大语言模型(LLM)也被探索作为传统标签方法的替代方案。研究表明,经过指令微调的模型可以通过提示工程生成性别受控的输出([12](https://arxiv.org/html/2608.08606#bib.bib16)、[13](https://arxiv.org/html/2608.08606#bib.bib17))。这些模型可以根据上下文线索或示例分别生成阳性和阴性译文。然而,这些工作大多集中在西班牙语、法语、德语等高资源语言上。类似 WMT 2020 性别共指和偏见任务等共享任务评估进一步凸显了众多提交的 MT 系统和目标语言中持续存在的性别偏见([5](https://arxiv.org/html/2608.08606#bib.bib18))。迄今为止,英语–罗马尼亚语 MT 中的性别偏见仍未得到解决。罗马尼亚语因其三性别系统和复杂的形态一致关系而面临特殊挑战。

## 3 EnGen:英语性别消歧数据集

我们构建了两个数据集,用于微调 LLM 以预测给定上下文中目标词的性别。该过程是半自动化的——由一位罗马尼亚语母语者创作句子,通过 OpenAI API 使用 GPT 生成更多示例([6](https://arxiv.org/html/2608.08606#bib.bib4))[2],然后由母语者再次检查并过滤输出。数据集采用两阶段课程学习方法,训练从较简单的示例开始,并逐步增加难度:

### 3.1 数据集 1 —— 单实体短语

图 1:数据集 1 的分布。左:阴性、阳性和歧义实体的性别分布均衡。中:家庭、动物、角色、职业、姓名相关名词的类别分布均衡。右:大多数短语只包含一个句子,其次是两个和三个句子的上下文长度。

数据集 1 包含 11,472 个示例。每个示例包含一个可性别化的词,如职位名称、家庭成员、动物、角色或专有名称。短语最多可包含三个句子。我们使用“歧义”来表示无法从上下文中推断性别的情况;该类别包括性别中立或非二元指代(例如“they”),而不对说话者的性别身份作任何假设。数据集中各类别的分布统计见图 1。数据生成过程从单句上下文开始。对于每个语义类别,使用单独的提示来创建目标词性别清晰或歧义的示例。完成单句上下文的全部类别后,该过程在双句上下文中重复,然后再次在三句上下文中重复。在所有上下文长度下,数据集都保持均衡,尽可能使阴性、阳性和歧义示例的数量接近。

表 1:数据集 1 的示例。每个句子包含一个目标词及其对应的性别。

### 3.2 数据集 2 —— 多实体短语

数据集 2 包含 996 个具有唯一目标词的示例。每个句子恰好包含两个可性别化的词:目标词(需要预测性别)和干扰词(用于增加任务复杂度)。上下文长度为一个或两个句子。干扰实体的性别是歧义的,并放置在句子中的不同位置以降低可预测性。我们确保性别表示均衡(阴性、阳性、歧义),同时保持周围上下文在各变体之间高度相似。每个目标词都对应所有三种性别标签,且上下文在语义和句法上保持自然。格式与数据集 1 相同,由输入(句子、目标词和类别)和输出(性别标签)组成。

表 2:数据集 2 的三元组示例。这里“librarian”是目标词,“teacher”、“student”、“detective”是上下文中其他可性别的实体。

### 3.3 数据集划分

两个数据集都被划分为训练集、验证集和测试集,以支持两阶段微调流程。划分设计旨在保持类别平衡并避免数据泄漏。对于数据集 1(D1),我们使用按性别和类别分层的 80/10/10 划分,确保每个性别–类别组合按比例表示。结果规模为:训练集 9,177,验证集 1,147,测试集 1,148。对于数据集 2(D2),我们使用 70/15/15 的三元组锁定划分:每个(阳性、阴性、歧义)三元组获得一个组 ID,整个组被分配到恰好一个分区(训练、验证或测试)。这保证来自同一三元组的任何变体不会出现在不同划分中,包括测试集。结果规模为:训练集 699,验证集 150,测试集 147。训练集用于参数更新,验证集用于超参数选择,测试集严格保留给最终评估。

我们采用课程学习方法:数据集 1 包含单实体短语,使模型能够先学习从上下文到性别的基本映射,而不会受到干扰。数据集 2 通过两个可性别化的词(一个目标词和一个干扰词)在位置和线索上的变化来提高难度。

## 4 EnRoGend:英语–罗马尼亚语性别标签平行数据集

该数据集包含 1,974 个示例,按对组织:同一句子的两个版本,每个版本中相同目标词分别标记为阳性和阴性。每个示例包含英语源句,其中目标词被性别标签 `<m>目标词</m>` 或 `<f>目标词</f>` 包围,以及对应的罗马尼亚语译文(无标签)。该数据集仅包含职业和与人相关的名词,目的是教会 MT 系统在看到 `<f>` 时使用阴性形式,在看到 `<m>` 时使用阳性形式。

该数据集的构建始于一份包含 82 个表示工作和角色的实体的预定义列表。对于每个实体,我们编写 10 到 15 个句子,使用阴性代词(she)来引导实体性别,然后使用阳性代词复制该句子;参见表 3。所有句子都被翻译成罗马尼亚语,并由两位标注者验证。数据集在性别目标词之间保持平衡,包含 987 个阳性实例和 987 个阴性实例,覆盖 82 个不同的职业。

表 3:英语–罗马尼亚语性别标签数据集中的一对示例。

- 英语:The teacher thanked the `<m>lawyer</m>` since he had been generous throughout the project.
- 罗马尼亚语:Profesorul i-a mulțumit avocatului, deoarece fusese generos pe parcursul proiectului.

- 英语:The `<f>journalist</f>` advised the painter on the task because she was kind.
- 罗马尼亚语:Jurnalista l-a sfătuit pe pictor pentru că era amabilă.

我们采用类似的配对锁定策略来划分机器翻译数据集,以避免近似重复泄漏。每个示例属于一个 2 项最小对。我们不逐行打乱,而是打乱配对,并让配对的两个成员始终位于同一分区。划分比例为 80% 训练、10% 验证和 10% 测试。这保证如果某句子的阳性变体在训练集中,其阴性对应版不会出现在验证集或测试集中(反之亦然),包括保留测试集。这样就能进行公平的评估,而不会因近似重复示例而虚高。

## 5 方法

前面章节描述的数据集是首个针对英语–罗马尼亚语语言对解决性别偏见的数据集,因此能够支持构建端到端的机器翻译流水线。该流水线对输入句子执行一系列分析与生成阶段,以在翻译过程中保留预期的性别信息。首先识别可能需要性别实现的目标实体,然后由大语言模型根据语篇线索推断每个实体的上下文性别。推断出的性别信息随后编码为行内标签,并合并回原始句子,形成显式表达性别约束的中间表示。这个带标签的句子随后被送入机器翻译系统,系统利用这些注释在目标语言中选择恰当的性别形式,从而减少对默认或偏见性别选择的依赖。整个过程如图 2 所示。

为了使流水线在现实场景中具备性别感知能力,流水线依赖一个实体选择器(Entity Selector),它使用预定义的可性别实体列表作为性别推断的候选目标。该列表基于先前研究([3](https://arxiv.org/html/2608.08606#bib.bib3))编制。输入句子中的每个词都会与该列表进行匹配,以识别需要推断性别的角色名词或职业名词。为增强鲁棒性,系统使用模糊字符串匹配来处理拼写错误、复数形式和轻微词汇变体。

用户输入句子:The doctor congratulated the nurse because he did a good job.

实体选择器:识别出:doctor、nurse

LLM 性别分类:目标词:doctor → 歧义;目标词:nurse → 阳性

合并后的带标签句子:The doctor congratulated the `<m>nurse</m>` because he did a good job.

机器翻译(MT)输出:Doctorul l-a felicitat pe asistent pentru că a făcut o treabă bună.

图 2:端到端流水线示例。系统接收英语句子,提取候选实体,使用 LLM 对每个实体进行性别分类,为可性别实体插入标签,并将带标签的句子翻译成罗马尼亚语。

### 5.1 LLM 性别分类

在这一步中,主要目标是获得一个快速且易于部署到 MT 系统中的分类器。因此,我们采用来自 Unsloth([18](https://arxiv.org/html/2608.08606#bib.bib6))的预训练 LLaMA 3.2(1B 参数)模型。为了使微调在有限硬件上可行,模型以 4 位 NF4 量化加载,并使用混合精度进行微调。我们采用低秩自适应(LoRA)([4](https://arxiv.org/html/2608.08606#bib.bib7))。LoRA 不更新完整的权重矩阵 \(W_0 \in \mathbb{R}^{d \times k}\),而是学习一个低秩更新:

\[
W = W_0 + \Delta W,\qquad \Delta W = \frac{\alpha}{r} AB,
\]

其中 \(A \in \mathbb{R}^{d \times r}\),\(B \in \mathbb{R}^{r \times k}\),\(r \ll \min(d,k)\),\(\alpha\) 对更新进行缩放。冻结的 \(W_0\) 保留预训练知识,而 \(\Delta W\) 捕获任务特定的调整。LoRA 适配器被插入到 query、key、value、output、gate、up 和 down 投影层中,以在保持高效训练的同时适配性别分类任务。

相似文章

解释GAND:性别模糊自然数据与对比归因资源

arXiv cs.CL

本文介绍了GAND,这是一个用于分析机器翻译中性别偏见的性别模糊自然英语句子的基准测试资源,并利用对比翻译进行可解释性分析,以揭示影响性别分配的源词。

将LLM性别偏见锚定于人类基线:一项跨语言审计

arXiv cs.CL

本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。