解释GAND:性别模糊自然数据与对比归因资源
摘要
本文介绍了GAND,这是一个用于分析机器翻译中性别偏见的性别模糊自然英语句子的基准测试资源,并利用对比翻译进行可解释性分析,以揭示影响性别分配的源词。
arXiv:2607.22546v1 公告类型:新
摘要:机器翻译(MT)系统持续产生带有性别偏见的翻译。在自我表达至关重要的时代,基于默认行为和刻板印象的错误翻译可能会对这些系统的用户造成伤害。为了更好地理解这些系统在缺乏明确性别线索时如何翻译性别,我们需要以自然方式反映性别模糊场景的基准测试资源。为此,我们提出了GAND,这是一个用于MT的性别模糊自然数据基准测试资源,由英语源句组成,专门设计用于分析上下文线索对翻译中性别的影响。我们利用GAND进行可解释性分析:将GAND的一个子集翻译成两种语法性别语言,并辅以人工制作的对比翻译。随后的特征归因分析揭示了源词在上下文中的影响,这些影响决定了目标翻译中模糊指代实体的性别翻译。
查看缓存全文
缓存时间: 2026/07/28 06:27
# 关于性别歧义自然数据与对比归因的资源
来源:https://arxiv.org/html/2607.22546
Janiça Hackenbuchner, Jasper Degraeuwe, Arda Tezcan and Joke Daems
语言与翻译技术团队 (LT3)
翻译、口译与传播系
根特大学,比利时
\{firstname\.lastname\}@ugent\.be
###### 摘要
机器翻译(MT)系统持续产生带有性别偏见的翻译。在自我表达至关重要的时代,基于默认行为和刻板印象的错误翻译可能对这些系统的用户造成伤害。为了更好地理解这些系统在缺乏明确性别线索时如何翻译性别,我们需要能够自然反映性别歧义场景的基准测试资源。为此,我们提出了GAND,一个由英语源句组成的性别歧义自然数据基准测试资源,专门设计用于分析上下文线索对翻译中性别的影响。我们利用GAND进行可解释性分析:我们将GAND的一个子集翻译成两种语法性别语言,并用手工制作的对比翻译进行扩展。随后的特征归因分析揭示了上下文中影响目标翻译中歧义指代实体性别翻译的源词。
## 1 引言
机器翻译(MT)系统和大型语言模型(LLM)长期以来被证明表现出性别偏见行为,通常默认使用通用阳性形式或基于性别刻板印象做出假设[3 (https://arxiv.org/html/2607.22546#bib.bib44),32 (https://arxiv.org/html/2607.22546#bib.bib65),37 (https://arxiv.org/html/2607.22546#bib.bib43),19 (https://arxiv.org/html/2607.22546#bib.bib71),42 (https://arxiv.org/html/2607.22546#bib.bib31),12 (https://arxiv.org/html/2607.22546#bib.bib75)]。当从性别标记有限的概念语言(如英语)翻译到具有明显性别区分的语法语言(如德语或西班牙语)时,MT系统倾向于将语法性别分配给歧义指代实体。Rarrick等人[28 (https://arxiv.org/html/2607.22546#bib.bib39), p. 845]将这种现象称为“任意性别标记实体”,即指代(或生命)实体被任意标记性别,尽管源语言中并未暗示性别。在缺乏明确语法性别线索的歧义源语言中,MT系统绝大多数情况下默认使用通用阳性形式或基于刻板印象的翻译[14 (https://arxiv.org/html/2607.22546#bib.bib25),23 (https://arxiv.org/html/2607.22546#bib.bib41)],而人类已被证明对歧义指代实体的解读更加多样化[16 (https://arxiv.org/html/2607.22546#bib.bib17)]。
*请参见图注*
图1:GAND创建过程信息图及通过对比翻译进行可解释性分析的简化可视化。
过去十年中,关于MT中性别偏见的研究广泛展开,发布了大量数据资源,用于基准测试最先进的MT系统和通用基础模型,以评估和减轻性别偏见[36 (https://arxiv.org/html/2607.22546#bib.bib9)],其中一部分在第2.1节(https://arxiv.org/html/2607.22546#S2.SS1)中介绍。然而,在这些海量数据资源中,仍然缺乏能够捕捉自然环境中完全性别歧义现象的数据集,因为这类数据不易自动收集。因此,尽管从翻译角度来看至关重要,该现象仍然研究不足。由于歧义句在翻译中非常常见,并且已被发现对MT系统特别具有挑战性[33 (https://arxiv.org/html/2607.22546#bib.bib61)],我们需要合适的数据资源来研究它们。
除了需要合适的数据资源,对可解释人工智能(XAI)的需求也日益增长\räuker2023,[10 (https://arxiv.org/html/2607.22546#bib.bib10)],以理解模型何时基于敏感属性做出偏见预测,并据此为模型训练中的社会偏见缓解策略提供信息。为了更好地理解和揭示MT系统中性别选择背后的机制,MT(以及最近也包括语音翻译;Conti等人[6 (https://arxiv.org/html/2607.22546#bib.bib15)])中的性别偏见越来越多地通过可解释性技术进行研究。在这些技术中,指代消解已通过注意力机制[8 (https://arxiv.org/html/2607.22546#bib.bib52),22 (https://arxiv.org/html/2607.22546#bib.bib7)]以及特征归因[31 (https://arxiv.org/html/2607.22546#bib.bib8),1 (https://arxiv.org/html/2607.22546#bib.bib1)]进行了研究。在本文中,我们回应了这两项需求,并提出了GAND[1][2],一个关于性别歧义自然数据的数据资源,用于分析上下文线索对翻译中性别的影响。GAND由5047个英语句子组成,这些句子从自然数据中编译而来,并且对于一个给定的单数指代实体严格保持性别歧义。我们的方法结合了自动数据过滤、基于规则的清洗以及人工验证,展示了编译严格性别歧义但语言丰富的数据资源的难度。该数据集的重要贡献在于从(主要)合成模板转向自然数据,可用于在现实环境中评估模型固有的偏见。该资源是一个更大研究项目的基础,该项目旨在自动识别源句子中对特定指代实体的MT性别屈折影响最大的元素[15 (https://arxiv.org/html/2607.22546#bib.bib18)]。该项目是诊断性的,而非规范性的:在歧义场景中,并不存在唯一的“正确”翻译,而是应让用户意识到源语言中的歧义更可能导致明确性别输出的场景。考虑到上下文在翻译过程中提供了相关信息,我们想找出影响性别翻译的显著上下文,以更好地理解这种影响。为此,我们利用GAND来评估解释是否可用于检测模型何时基于显著归因做出性别偏见的预测。为此,我们将一个包含1000个句子的子集翻译成两种语法性别语言——西班牙语和德语,并手工扩展了对比翻译[44 (https://arxiv.org/html/2607.22546#bib.bib3)]。在这些基础上,我们进行了可解释性信息分析,以识别源语言中哪些上下文线索会影响目标语言中的性别翻译。GAND数据集的数据生成过程以及本研究中进行的可解释性分析如图1(https://arxiv.org/html/2607.22546#S1.F1)所示。因此,本文的贡献有两方面:(i) 我们提出了GAND,这是首个大规模的性别歧义自然数据资源,适用于MT基准测试;(ii) 我们通过对比翻译和显著性归因进行了可解释性信息分析,以展示影响翻译中性别的上下文线索。
## 2 相关研究
### 2.1 现有基准
以下简要讨论关键基准,但并不声称详尽。它们在文本中以*标记为基于人工数据,以°标记为基于自然数据。每个数据资源风格的示例句子见附录A.1(https://arxiv.org/html/2607.22546#A1.SS1)表7(https://arxiv.org/html/2607.22546#A1.T7)。
大多数现有数据资源由性别非歧义句子(针对特定指代实体)组成,其中研究了指代消解,包括WinoBias*[45 (https://arxiv.org/html/2607.22546#bib.bib37)]、WinoMT*[38 (https://arxiv.org/html/2607.22546#bib.bib70)]、SimpleGen*[29 (https://arxiv.org/html/2607.22546#bib.bib35)]、BUG°(基于维基百科和医学数据;Levy等人[21 (https://arxiv.org/html/2607.22546#bib.bib30)])、MT-GenEval°(基于维基百科;Currey等人[9 (https://arxiv.org/html/2607.22546#bib.bib73)])或MiTTens*°[30 (https://arxiv.org/html/2607.22546#bib.bib36)]等。最近的基准包含非歧义和歧义场景,如GLITTER°(基于维基百科和复数指代;Pranav等人[26 (https://arxiv.org/html/2607.22546#bib.bib78)])和GeNTE°及mGeNTE°(基于EuroParl,包括单数和复数指代;Piergentili等人[25 (https://arxiv.org/html/2607.22546#bib.bib2)]和Savoldi等人[35 (https://arxiv.org/html/2607.22546#bib.bib33)])。关于说话者的第一人称单数性别歧义(例如,“我出生在...”),且在其他情况下非歧义,可以通过Must-SHE语料库°(基于TedTalks;Bentivogli等人[2 (https://arxiv.org/html/2607.22546#bib.bib64)])和阿拉伯语平行性别语料库°(基于OpenSubtitles;Habash等人[13 (https://arxiv.org/html/2607.22546#bib.bib38)])进行评估。性别歧义还可以在GATE°*[28 (https://arxiv.org/html/2607.22546#bib.bib39)](一个语言构建的挑战集,包含单数和复数指代以及说话者歧义)、GENDEROUS*[14 (https://arxiv.org/html/2607.22546#bib.bib25)](一个严格人工的小型挑战集)或GAMBIT*[23 (https://arxiv.org/html/2607.22546#bib.bib41)]和GAMBIT+*[11 (https://arxiv.org/html/2607.22546#bib.bib67)](两者均为LLM生成且经过人工审核的数据集)中进行评估。为了突出GAND与现有数据集(例如GATE)的某些差异,我们在附录A.1(https://arxiv.org/html/2607.22546#A1.SS1)中提供了具体示例。Mastromichalakis[23 (https://arxiv.org/html/2607.22546#bib.bib41), p. 32227]最初意图生成一个逼真的、自然的性别歧义数据集,但得出结论认为“人工生成是确保完全职业覆盖和多样化文本风格的唯一可行方法”,而且这无疑是一种更省时的方法。Rarrick等人[28 (https://arxiv.org/html/2607.22546#bib.bib39), p. 848]同样表达了过滤GATE歧义自然数据的难度,因为他们的成功“取决于找到此类句子的相对容易程度”,并且他们转而手动“修改[句子]以略微符合要求”。因此,迄今为止,尚无一个广泛的数据集能够捕捉到在真实自然环境中针对单数指代实体的完全性别歧义现象。
**GAND资源**
“该国矫正调查员的一份报告称,过度拥挤是加拿大监狱变得愈加暴力的原因之一。”
“书记员给了嫌疑人一笔未公开金额的钱。”
“他的计划允许一名家庭助理每天来帮助Agnes起床,并担任个人助理,协助Agnes进行日常生活活动——梳洗、如厕、穿衣、进食、行走以及任何其他所需。”
表1:GAND数据集中包含的三个示例句子。歧义指代实体以斜体标示。
### 2.2 可解释性相关研究
##### 指代消解
对上述大多数基准的研究主要评估了MT系统和LLM在多大程度上遵循指代链,而最近的基准进一步关注性别中性和性别公平的翻译生成。WinoMT语料库[38 (https://arxiv.org/html/2607.22546#bib.bib70)]中的指代消解已通过Attanasio等人[1 (https://arxiv.org/html/2607.22546#bib.bib1)]的特征归因以及Manna等人[22 (https://arxiv.org/html/2607.22546#bib.bib7)]的注意力机制进行研究。Sarti等人[31 (https://arxiv.org/html/2607.22546#bib.bib8)]和Wisniewski等人[43 (https://arxiv.org/html/2607.22546#bib.bib40)]对其手工制作的测试集进行了可解释性信息分析。结果显示,准确的性别消解关键取决于正确的指代消解[43 (https://arxiv.org/html/2607.22546#bib.bib40),22 (https://arxiv.org/html/2607.22546#bib.bib7)]。当模型未能正确解决指代时,它们会导致错误的预测,默认使用阳性翻译[31 (https://arxiv.org/html/2607.22546#bib.bib8),1 (https://arxiv.org/html/2607.22546#bib.bib1)]。虽然源语言中的上下文线索已被证明会影响MT系统在目标语言中分配的性别,但这可以通过指代[18 (https://arxiv.org/html/2607.22546#bib.bib29)])来解释,但在歧义场景中尚未得到解释。
##### 对比解释
作为可解释性方法,对比解释已被证明优于其他方法,展示了哪些输入词元导致模型预测一种输出(目标)而非另一种(对照)[44 (https://arxiv.org/html/2607.22546#bib.bib3)]。对比解释已在之前的翻译研究中成功应用于性别(例如,为什么预测M而不是F?)[40 (https://arxiv.org/html/2607.22546#bib.bib54),31 (https://arxiv.org/html/2607.22546#bib.bib8),7 (https://arxiv.org/html/2607.22546#bib.bib42),17 (https://arxiv.org/html/2607.22546#bib.bib34)]。基于Must-SHE语料库[2 (https://arxiv.org/html/2607.22546#bib.bib64)],Conti等人[6 (https://arxiv.org/html/2607.22546#bib.bib15),7 (https://arxiv.org/html/2607.22546#bib.bib42)]利用语音翻译中的对比特征归因来揭示,为了准确翻译性别,模型依赖于第一人称代词将性别术语与说话者联系起来。基于一小部分性别歧义句子,Hackenbuchner等人[17 (https://arxiv.org/html/2607.22546#bib.bib34)]利用对比翻译来研究合理性,即“人类可解释性”[20 (https://arxiv.org/html/2607.22546#bib.bib53)],这指的是模型理由与人工标注者识别的显著源词之间的一致性。他们表明,模型和人类在很大程度上是一致的,在(歧义)上下文中受到相似的内容词的影响。在本文中,我们基于先前的研究,利用GAND通过对比翻译进行可解释性信息分析。在缺乏明确性别和/或指代线索的情况下,我们找到了句子上下文中影响模型选择特定性别而非其他性别的显著源词。
## 3 数据编译
迄今为止,尚无一个数据集能够捕捉到在真实自然环境中针对单数指代实体的完全性别歧义现象。为了填补这一空白,我们提出了GAND,一个编译了5047个英语自然性别歧义句子、指代单数指代实体的数据集。为了涵盖多种主题和语言多样性,GAND从两个自然来源编译:C4 Common Crawl[1](EN子集)和Open Subtitles[2](来自OPUS项目[3]的单语EN数据)。由于缺乏自动化处理性别歧义数据的方法——这在先前的研究中已因难度而被放弃——我们采用了多步骤方法。
[1] https://huggingface.co/datasets/allenai/c4
[2] https://opus.nlpl.eu/OpenSubtitles/corpus/version/OpenSubtitles
[3] https://opus.nlpl.eu/相似文章
将LLM性别偏见锚定于人类基线:一项跨语言审计
本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。
MORPHOGEN:评估性别感知形态生成的多语言基准
研究者发布 MORPHOGEN,一个多语言基准,用于测试大模型能否在法语、阿拉伯语和印地语中将第一人称句子改写为相反性别,同时保留原意。
当名字不是名字:低资源大语言模型中文化纠缠的孟加拉语同形词的基准数据集与蒸馏推理
本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。
GAVEL:有依据的描述错误验证与定位
GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。
使用探针目标归因定位大型语言模型中的提示模糊性
介绍了PRIG,一种梯度归因方法,通过训练线性探针区分清晰提示和模糊提示,并将探针得分归因于残差流中的标记表示,从而定位大型语言模型中的提示模糊性,在合成和人工编写的基准测试上取得了强劲性能。