通过人机协作构建可扩展且文化特异性的刻板印象数据集
摘要
介绍了一种经济高效的人机协作标注框架,用于构建涵盖多个西班牙语国家的西班牙语刻板印象数据集EspanStereo,从而在大型语言模型中实现更具文化基础的偏见评估。
查看缓存全文
缓存时间: 2026/07/10 06:11
# 可扩展且文化特定的刻板印象数据集构建:人机协作方法 **来源:** https://arxiv.org/html/2607.07895 ###### 摘要 **警告:** 本文包含可能令人不适的内容示例。 关于大型语言模型(LLM)中刻板印象的研究主要集中在英语语境,这是因为其他语言缺乏数据集,且代表性不足的文化中人工标注成本高昂。为填补这一空白,我们提出了一种成本高效的人机协作标注框架,并将其应用于构建 *EspanStereo*——一个覆盖欧洲和拉丁美洲多个西班牙语国家的西班牙语刻板印象数据集。EspanStereo 同时捕捉了既有文献中记载充分的刻板印象以及以英语为中心的资源中所缺失的文化特定偏见。通过使用 LLM 生成候选刻板印象并由文化内部标注者进行验证,我们证明了该框架在识别细微、区域特定偏见方面的有效性。我们使用 EspanStereo 对支持西班牙语的 LLM 进行评估,发现这些模型在不同国家的刻板印象行为存在显著差异,凸显了进行更多基于文化评估的必要性。除了西班牙语,我们的框架还能适应其他语言和地区,为多语言刻板印象基准提供了一条可扩展的路径。本研究拓宽了 LLM 中刻板印象分析的范围,并为全面的跨文化偏见评估奠定了基础。 --- ## 可扩展且文化特定的刻板印象数据集构建:人机协作方法¹¹ --- ## 1 引言 大型语言模型(LLM)的兴起推动了计算语言学的发展,但也带来了因嵌入刻板印象而引发的挑战。现有的偏见检测与缓解方法依赖于精心标注的数据集,如 StereoSet(Nadeem 等,2021)和 CrowS-Pairs(Nangia 等,2020),但这些数据集仅限英语,且反映了少数英语国家(主要是美国)的刻板印象。这种狭窄的视角限制了针对非英语(通常为低资源)文化中刻板印象的研究。此外,即便是同一种语言内部,刻板印象也存在差异。例如,美国和英国虽然都以英语为主要语言,但“乡村地区沉迷枪支”的刻板印象是美国特有的,而“足球狂热”则更常与英国关联。现有数据集(尤其是基于翻译的数据集)常常忽略此类文化差异。为了推进 LLM 中的刻板印象研究,全面且文化多样的刻板印象检测数据集必不可少。然而,现有数据集构建的主要方法——人工数据收集(Nadeem 等,2021;Nangia 等,2020;Felkner 等,2023;Zhao 等,2018)——成本高昂且劳动密集,在人口较少的地区尤为突出。人工数据收集中最耗费资源的阶段是刻板印象获取,因为要确保国家特定代表性,需要足够大且多样化的参与者样本。构建针对具体国家的数据集尤其困难,因为其依赖的参与者池比覆盖整个语言的数据集更为狭窄。 为解决这一挑战,我们提出了一种人机协作的刻板印象标注框架:从 LLM 获取候选刻板印象,而非通过人工标注。这些生成的刻板印象随后由文化内部标注者进行**验证和实例化**,以确保质量和准确性。利用该框架,我们构建了 EspanStereo——一个覆盖西班牙、墨西哥、阿根廷、哥伦比亚和尼加拉瓜特定刻板印象的西班牙语刻板印象检测数据集。据我们所知,EspanStereo 是首个专门为刻板印象分析设计的原生西班牙语数据集。EspanStereo 与现有关于这些西班牙语国家刻板印象的文献高度吻合(详见 5.1 节)。此外,它还捕捉了一些在拉丁美洲/西班牙特定社会学文献中尚未被广泛记载的、代表性不足的刻板印象,例如:“老年人占据地方政府职位,牺牲了年轻一代的利益”***(EspanStereo 中的所有刻板印象原文均为西班牙语。为方便来自不同语言背景的读者,我们已将其翻译为英语。)***(哥伦比亚)、“克里奥尔人傲慢自大”(尼加拉瓜)以及“巴基斯坦人在呼叫中心工作,损害了西班牙社会”(西班牙)。此外,EspanStereo 中的刻板印象具有国家特异性——不同国家之间存在差异(4.2 节),并且与现有英语刻板印象数据集或从英语翻译而来的数据集存在显著不同(5.2 节)。 利用 EspanStereo,我们采用探测与剪枝方法(Ma 等,2023b)分析支持西班牙语的 Transformer 架构 LLM(具体为 XLM-R(Conneau 等,2020)和 BETO(Cañete 等,2020))中刻板印象的普遍性和编码行为。结果显示,EspanStereo 所研究的五个国家在刻板印象水平及编码模式上均存在显著差异。这证实了刻板印象中区域差异的存在,并强调需要针对具体国家来解决这些差异。我们的发现凸显了在 LLM 中进行更细粒度、多语言刻板印象评估的必要性。由于我们的数据构建框架与语言和文化无关,因此它为实现这一目标提供了一种高效、成本效益良好的解决方案。 --- ## 2 背景 近年来,针对非英语和多语言 LLM 中社会偏见的研究日益增多。Wang 等(2024)发现,多语言 LLM 在被问及 14 个常见安全问题时,若使用非英语语言,会返回更多不安全的回答。Levy 等(2023)证明,多语言 BERT 情感模型在意大利语、中文、英语、希伯来语和西班牙语中都表现出对文化主导群体的一致偏好。最后,Öztürk 等(2023)对德语、法语、西班牙语和土耳其语的单语及多语言 LLM 进行了偏见基准测试。此类研究将受益于更丰富的跨语言和跨文化刻板印象检测数据集。Alemany 等(2022)明确呼吁建立针对拉丁美洲文化的刻板印象数据集,但并未自行提供。然而,目前生成此类数据集的方法尚不充分。那些翻译现有英语数据集的工作(如 Névéol 等,2022;Neplenbroek 等,2024;Reusens 等,2023;Fort 等,2024;Vashishtha 等,2023)保留了美国文化细微差别,未能捕捉目标文化中特定的刻板印象——这一局限性已得到 Neplenbroek 等(2024)和 Névéol 等(2022)的承认。诸如 Mitchell 等(2025)的研究则通过文化内部标注者手动收集刻板印象,构建了丰富、文化特定的基准。然而,这种方法资源密集、难以扩展,且在当前结果数据集中排除了西班牙语世界。综合来看,这些限制严重阻碍了真正具有代表性、跨文化资源的开发。 我们通过采用人机协作框架来解决这些问题——这是刻板印象研究领域中新兴的范式。Jha 等(2023)使用 LLM 生成(群体,属性)元组,每个元组对应一个针对该群体的刻板印象。然而,该数据集仅涵盖与国籍相关的刻板印象,且局限于可被单个属性捕捉的简单刻板印象。Bhutani 等(2024)扩展了 Jha 等(2023)的框架,为 20 种语言生成了刻板印象元组,但继承了相同的结构限制。Dev 等(2023)承认了对文化特定刻板印象数据集的需求以及 LLM 协助构建的潜力,但并未将其方法论扩展到基于国籍的刻板印象或(群体,属性)元组之外。最后,Ma 等(2023a)使用 LLM 生成关于交叉群体的刻板印象,但仅限于美国文化背景。生成复杂刻板印象(超越简单属性元组)并确保其文化适当性的跨语言框架仍有待探索。我们的数据生成方法论旨在填补这一空白,提高他人创建可扩展、文化特定数据集的能力,同时降低成本。 --- ## 3 数据集构建框架 构建刻板印象检测数据集是一项资源密集的任务,尤其是在刻板印象收集阶段——这需要广泛的文化专业知识和细致的人工整理。鉴于在主观的刻板印象相关标注任务中,标注者间存在显著分歧(Uma 等,2021),大范围的人工收集对于实现全面覆盖是必要的。这一挑战在非英语语言和文化中更为突出,因为相关社会学研究和代表性仍然有限。 为应对这一挑战,我们提出利用 LLM 来整理潜在的刻板印象列表(3.1 节),然后由文化内部标注者进行手动验证(3.2 节)和实例化(3.3 节)。刻板印象本质上是“对某一特定类型的人或事物广泛持有但固定且过度简化的形象或观念”(牛津语言定义†††https://languages.oup.com/definition),因此必须在语言资源(包括用于训练 LLM 的语料库)中频繁出现。这使得 LLM 成为识别刻板印象的宝贵来源。我们的方法相比人工刻板印象整理具有两个关键优势:1)标注者只需验证刻板印象,无需生成;2)对于 LLM 训练数据中涵盖的任何语言和文化,都可以快速生成候选刻板印象。这些优势共同减少了寻找和培训标注者所需的时间和资源,特别是在低资源文化中,招募人员参与长期刻板印象编译任务可能非常困难。 ### 3.1 基于 LLM 的刻板印象检索 由于刻板印象可能包含冒犯性或有害内容,许多闭源 LLM(例如 GPT-4 和 Google Gemini)通过内置审查机制(图 H1)禁止生成此类内容,因此需要策略性提示才能从 LLM 中获取刻板印象。为克服这一限制,我们提出了一种针对 LLM 的注入攻击,诱导模型生成刻板印象内容。需要注意的是,虽然数据集构建过程中使用的 LLM 选择是任意的,但所收集刻板印象的覆盖范围可能有所不同,并且可能需要调整注入提示才能从不同模型中检索到刻板印象。为清晰起见,我们在图 1 中展示了刻板印象检索提示及 GPT-4o 模型的示例响应。我们为 Google Gemini 和 Llama-3.1-70b 采用的提示见附录 A 图 A1 和图 A2,其响应比较见图 A3。更多细节请参见附录 A。  **图 1:** 针对 GPT-4o 的注入攻击示例。模型输出已为简洁而截断。所有内容均从西班牙语翻译而来。原始提示见图 H3。 在提示时,我们对目标区域和群体施加精确约束,以最小化 LLM 产生幻觉并生成无关刻板印象的风险——这是涉及 LLM 的计算社会科学应用中的一个已知问题(Ma 等,2023a)。在本研究中,我们收集与种族、宗教、年龄、性取向和性别相关的刻板印象——这些身份常受刻板印象影响,但我们的框架易于扩展到其他类别。为确保生成刻板印象的全面覆盖,我们采用两种技术。首先,我们要求模型从不同视角生成刻板印象(见附录 C)。其次,我们重复每个生成提示,直到模型不再生成新的刻板印象。在构建 EspanStereo 时,我们使用了六个不同的视角,并针对每个视角平均重复生成提示三次。我们使用目标文化的语言(构建 EspanStereo 时使用西班牙语)进行所有提示,以引出最真实的示例,因为刻板印象通常具有地域特异性。 ### 3.2 手动刻板印象验证 在从 LLM 收集到初步刻板印象列表后,我们聘请文化内部标注者进行验证。为确保验证质量,验证者必须出生并成长于目标国家,且熟练掌握目标语言。每位验证者仅分配与其本国相关的数据点。验证过程中,我们询问验证者某个特定刻板印象在其国家是否常见,使用 5 点李克特量表,其中 1 表示该刻板印象在目标文化中从未观察到,5 表示非常普遍的刻板印象(Grim,1936)。这种设计使我们能够捕获既普遍又更微妙、中等程度存在的偏见;初步试验中使用二分的是/否标签导致标注者仅确认最极端的刻板印象。示例问卷见图 D1。多数验证者认为罕见的刻板印象(中位数评分 ≤ 2)将被舍弃以确保数据质量‡‡‡虽然 Uma 等(2021)强调了在刻板印象相关任务中标注者间一致性的局限性,但并未提出适用于我们需求的实用替代方案。通过采用多数投票方法,我们减轻了个人偏见的影响。我们还收集非敏感的人口统计信息,用于(原文在此中断,但根据上下文应继续描述)
相似文章
将LLM性别偏见锚定于人类基线:一项跨语言审计
本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。
AlignCultura:迈向文化对齐的大语言模型?
AlignCultura 推出基于 UNESCO 框架的 CulturaX 数据集与两阶段对齐流程,在 Qwen3-8B 与 DeepSeek-R1-Distill-Qwen-7B 上实现 HHH 指标提升 4–6%,文化失误率降低 18%。
BIASEDTALES-ML:用于分析大语言模型生成故事中叙事属性分布的多语言数据集
# BIASEDTALES-ML:用于分析大语言模型生成故事中叙事属性分布的多语言数据集 来源:[https://arxiv.org/html/2604.17008](https://arxiv.org/html/2604.17008) Yuxuan Ouyang1,Yingfeng Luo1,Tong Xiao1,2,Jingbo Zhu1,2 1中国沈阳东北大学计算机科学与工程学院 2中国沈阳 NiuTrans Research [email protected] {xiaotong,zhujingbo}@mail.neu.edu.cn ###### 摘要 大型语言模型(LLM)正日益被广泛用
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。
我们能否定位并防止LLM中的刻板印象?
arXiv预印本在GPT-2 Small与Llama 3.2中定位编码刻板印象的神经元与注意力头,显示偏见集中在少数神经元子集,但消融它们几乎无法减少带偏文本生成。