解构刻板印象:用于有效多语言反驳言论的范围条件生成

arXiv cs.CL 论文

摘要

本文提出一种新的范围条件生成框架,该框架将结构化刻板印象特征整合到大型语言模型提示中,以实现有效的多语言反驳言论,并在一个由人工整理的数据集上验证,显示在事实性和有效性方面有显著提升。

arXiv:2609.16906v1 公告类型:新 摘要:反驳言论(CS)——使用推理和替代观点来对抗在线仇恨言论(HS)的直接回应——已成为内容移除的一种替代方案。然而,当前的自动CS生成方法经常产生通用且无效的回复,未能针对HS背后的隐含刻板印象。为弥补这一差距,我们提出了一种新的范围条件生成框架,该框架显式地将结构化刻板印象特征整合到大型语言模型提示中。我们在一个新颖的、人工整理的数据集上验证了我们的方法,该数据集以英语、意大利语和西班牙语标注。广泛评估表明,刻板印象条件提示在所有三种语言中都显著优于通用基线,在事实性、具体性、连贯性和有效性方面对显性和隐含暗示的刻板印象都取得了显著提升。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:55

# 面向有效多语言反驳话语的范围限定生成  
来源:https://arxiv.org/html/2609.16906  
## 解构刻板印象:面向有效多语言反驳话语的范围限定生成  
Elias Urios Alacreu  
机构:西班牙瓦伦西亚理工大学PRHLT研究中心,瓦伦西亚,西班牙  
Elena Cabrio  
机构:法国蔚蓝海岸大学、CNRS、INRIA、I3S,法国  
Paolo Rosso  
机构:西班牙瓦伦西亚理工大学PRHLT研究中心,瓦伦西亚,西班牙  
机构:西班牙瓦伦西亚人工智能研究生院与研究网络(ValgrAI),西班牙  
通讯作者:[[email protected]](mailto:[email protected])  
Serena Villata  
机构:法国蔚蓝海岸大学、CNRS、INRIA、I3S,法国  

###### 摘要  
反驳话语(CS)——通过推理与替代视角直接回应在线仇恨言论(HS)的言论——已成为内容移除的替代方案。然而,当前的自动CS生成方法常产生泛化、无效的回复,未能针对HS背后的隐含刻板印象。为弥合此差距,我们提出一种新颖的范围限定生成框架,将结构化的刻板印象特征显式融入大语言模型提示中。我们在一个全新的人工整理、标注英语、意大利语和西班牙语的数据集上验证了该方法。广泛评估表明,基于刻板印象限定的提示生成在所有三种语言中显著优于通用基线,在事实性、特异性、连贯性与有效性方面获得显著提升,适用于显性与隐性刻板印象。  
内容提示:本文包含部分读者可能感到冒犯的仇恨言论示例。  

## 1 引言  
仇恨言论(HS)可广义定义为基于受保护特征(如种族、民族、性别、性取向、宗教或国籍)贬低个人或群体的任何言论(Nockleby, 2000 (https://arxiv.org/html/2609.16906#bib.bib46))。随着社交媒体平台的迅速扩张,HS已从边缘现象演变为普遍存在。自然语言处理(NLP)社区主要通过检测技术(Fortuna and Nunes, 2018 (https://arxiv.org/html/2609.16906#bib.bib72); Rawat et al., 2024 (https://arxiv.org/html/2609.16906#bib.bib75))标记并大规模移除仇恨内容来应对这一挑战。虽然检测提供了必要的第一道防线,但它仅解决了问题的表象。内容审核移除了信息,却未触及潜在偏见,使得仇恨叙事在其他平台或用户间重现。因此,越来越多的研究关注反驳话语(CS)生成,旨在通过建设性对话直接驳斥、缓和或重构仇恨内容(Benesch, 2014 (https://arxiv.org/html/2609.16906#bib.bib30); Bonaldi et al., 2024a (https://arxiv.org/html/2609.16906#bib.bib76))。  

HS的一个基础但常被忽视的驱动因素是其根植于刻板印象:这些深植的认知结构扭曲社会认知、强化不平等,并为歧视行为提供正当性(Augoustinos and Walker, 1998 (https://arxiv.org/html/2609.16906#bib.bib44))。反复暴露于刻板印象会使偏见正常化,随时间演变为公开的偏见并助长HS(Cignarella et al., 2025 (https://arxiv.org/html/2609.16906#bib.bib45))。这一关联是HS运作的核心,事实上,仇恨信息通过依赖受众已接受的错误信念来说服。因此,有效的CS不仅需针对信息的表层文本,还应针对其依赖的潜在刻板印象。  

然而,刻板印象在HS中的表现形式各异:部分信息显式陈述刻板印象(如声称“女性生活轻松;她们待在家生孩子”),而另一些则通过敌意或隐喻隐式暗示,未直接点明前提(如通过“我希望所有LGBT人群死于艾滋病”间接暗示该群体所有成员携带疾病)。为实现刻板印象的计算建模,NLP与CS领域的先前工作常依赖于揭示信息背后的未陈述前提。这种潜在刻板印象通常形式化为“隐含陈述”(IS),即简化的规范命题,结构为⟨目标群体⟩+关系+⟨归因属性⟩(Sap et al., 2020 (https://arxiv.org/html/2609.16906#bib.bib9); Akazawa et al., 2023 (https://arxiv.org/html/2609.16906#bib.bib43))。尽管IS表述使隐含信念显式化,有助于生成系统识别仇恨帖子的真正意图,但它依赖于一种舍弃关键结构细微差别的简化抽象。具体而言,它忽略了:  
(i) 归纳的范围(如主张是针对整个人口统计学的本质特征,还是特定子集);  
(ii) 被归因的特质类型(如主张暗示道德败坏还是生物学劣势)。  
忽略这些维度会导致现有CS系统可能生成泛化或不对齐的信息,未能针对HS的核心意图。  

为弥合此差距,我们引入一个覆盖英语(EN)、西班牙语(ES)和意大利语(IT)的新型多语言数据集,使用超越标准IS的精细标注方案描述刻板印象,涵盖所有这些维度。基于此数据集,我们的工作探讨以下研究问题:  
- • 研究问题1:基于刻板印象限定的生成能否提升CS质量,超越通用基线及仅基于IS的生成?  
- • 研究问题2:考虑到隐性刻板印象比显性情况具有更高的内在难度,基于刻板印象限定的生成能否仍对其产生效益?  
- • 研究问题3:基于刻板印象结构的生成能否跨语言迁移?  

我们的主要贡献有三点:  
1) 我们提出一个精细的刻板印象标注方案,将HS分解为显性/隐性刻板印象、归纳范围和归因特质类型。  
2) 我们发布了覆盖三种语言(EN, ES, IT)的高质量人工整理数据集,桥接HS与刻板印象建模及CS生成。数据样本与指南详见 [https://anonymous.4open.science/r/stereotypecs/README.md](https://anonymous.4open.science/r/stereotypecs/README.md)。  
3) 通过自动评估、大语言模型评判和人工评估,我们实证表明,基于刻板印象结构限定LLM生成CS,能显著提升所有三种语言以及显性与隐性刻板印象情况下的特异性、事实性与连贯性。  

## 2 相关工作  
**语言中的刻板印象**。NLP中刻板印象的研究是一个相对较新的领域,与HS和偏见密切相关。事实上,HS常通过泛指与语用隐含表达的隐性刻板印象传递伤害,而非明确侮辱(Fiske, 1998 (https://arxiv.org/html/2609.16906#bib.bib59); Leslie, 2014 (https://arxiv.org/html/2609.16906#bib.bib58); Sap et al., 2020 (https://arxiv.org/html/2609.16906#bib.bib9))。由于这些刻板印象信念难以改变,有效的干预应针对潜在推论,而非仅表层仇恨内容(Lepoutre, 2019 (https://arxiv.org/html/2609.16906#bib.bib66); Perez Gomez, 2021 (https://arxiv.org/html/2609.16906#bib.bib67))。心理学研究表明,通过反刻板印象示例、观点采择和促进平等主义规范等机制可减少刻板印象,但其效果因刻板印象和社会群体而异(Dasgupta and Greenwald, 2001 (https://arxiv.org/html/2609.16906#bib.bib61); Todd et al., 2011 (https://arxiv.org/html/2609.16906#bib.bib62); Wyer, 2010 (https://arxiv.org/html/2609.16906#bib.bib63); Forscher et al., 2019 (https://arxiv.org/html/2609.16906#bib.bib64); FitzGerald et al., 2019 (https://arxiv.org/html/2609.16906#bib.bib65))。  

**NLP中的刻板印象检测**。大多数NLP关于刻板印象的研究集中于将其作为监督分类任务进行检测。基于Transformer的模型在多种语言和基准测试中持续优于传统的基于特征的方法(Sanguinetti et al., 2020 (https://arxiv.org/html/2609.16906#bib.bib15); Sánchez-Junquera et al., 2021 (https://arxiv.org/html/2609.16906#bib.bib41); Pujari et al., 2022 (https://arxiv.org/html/2609.16906#bib.bib14); Bosco et al., 2023 (https://arxiv.org/html/2609.16906#bib.bib10); Vargas et al., 2023 (https://arxiv.org/html/2609.16906#bib.bib18); Cignarella et al., 2024 (https://arxiv.org/html/2609.16906#bib.bib11); Schmeisser-Nieto et al., 2025 (https://arxiv.org/html/2609.16906#bib.bib17); Urios-Alacreu and Rosso, 2025 (https://arxiv.org/html/2609.16906#bib.bib35))。相关工作还研究了语言模型中编码的刻板印象,并开发了测量和缓解表征与刻板印象偏见的方法(Bolukbasi et al., 2016 (https://arxiv.org/html/2609.16906#bib.bib21); Caliskan et al., 2017 (https://arxiv.org/html/2609.16906#bib.bib22); Zmigrod et al., 2019 (https://arxiv.org/html/2609.16906#bib.bib19); Sun et al., 2019 (https://arxiv.org/html/2609.16906#bib.bib20); Laiyk et al., 2026 (https://arxiv.org/html/2609.16906#bib.bib71))。尽管刻板印象检测已取得显著进展,但相对较少的工作探索了缓解或反驳刻板印象的方法。  

**刻板印象与CS数据集**。已有多个数据集用于刻板印象检测和偏见评估,包括CrowS-Pairs(Nangia et al., 2020 (https://arxiv.org/html/2609.16906#bib.bib39))、StereoSet(Nadeem et al., 2021 (https://arxiv.org/html/2609.16906#bib.bib12))、BBQ(Parrish et al., 2022 (https://arxiv.org/html/2609.16906#bib.bib40))、HONEST(Nozza et al., 2021 (https://arxiv.org/html/2609.16906#bib.bib13))以及多语言资源如StereoHOAX(Schmeisser-Nieto et al., 2025 (https://arxiv.org/html/2609.16906#bib.bib17))和QUEEREOTYPES(Cignarella et al., 2024 (https://arxiv.org/html/2609.16906#bib.bib11))。尽管这些数据集涵盖多样的偏见维度,但仍以英语为中心,多语言和低资源语言覆盖相对有限。此外,已创建多个数据集支持CS分析和生成。这些包括从社交媒体收集的CS(Mathew et al., 2019 (https://arxiv.org/html/2609.16906#bib.bib33); Garland et al., 2020 (https://arxiv.org/html/2609.16906#bib.bib34))以及专家整理的数据集如CONAN(Chung et al., 2019 (https://arxiv.org/html/2609.16906#bib.bib5))及其扩展(Fanton et al., 2021 (https://arxiv.org/html/2609.16906#bib.bib4); Bonaldi et al., 2022 (https://arxiv.org/html/2609.16906#bib.bib3); Bonaldi et al., 2025 (https://arxiv.org/html/2609.16906#bib.bib1))。尽管这些资源支持了自动CS生成,但它们很少标注其传达的潜在刻板印象。  

**CS与反刻板印象生成**。CS旨在通过共情、事实核查、幽默、谴责和警告后果等策略挑战有害内容(Benesch, 2014 (https://arxiv.org/html/2609.16906#bib.bib30))。基于此,NLP研究已探索使用人工撰写的回复(Qian et al., 2019 (https://arxiv.org/html/2609.16906#bib.bib29))、多样性和相关性导向的解码(Zhu and Bhat, 2021 (https://arxiv.org/html/2609.16906#bib.bib27))、针对回复语气的可控生成(Saha et al., 2022 (https://arxiv.org/html/2609.16906#bib.bib26))、少样本提示(Ashida and Komachi, 2022 (https://arxiv.org/html/2609.16906#bib.bib28))、论证组件(Bonaldi et al., 2024b (https://arxiv.org/html/2609.16906#bib.bib2))以及检索增强生成以构建基于事实的CS(Wilk et al., 2025 (https://arxiv.org/html/2609.16906#bib.bib23); Jiang et al., 2025 (https://arxiv.org/html/2609.16906#bib.bib24); Damo et al., 2025 (https://arxiv.org/html/2609.16906#bib.bib25))。然而,这些方法主要处理显性HS,侧重于回复风格,对反驳HS背后的隐含刻板印象关注有限。  

反驳刻板印象与CS密切相关,但侧重于挑战更微妙的有害语言形式,其中内容移除往往不合适。相反,回复旨在教育发言者、挑战刻板印象信念,并向旁观者表明此类言论不应不加质疑。然而,直接反驳刻板印象的研究相对有限。心理学研究表明,反刻板印象示例、人性化与事实纠正能有效挑战刻板印象信念(Finnegan et al., 2015 (https://arxiv.org/html/2609.16906#bib.bib69); Prati et al., 2016 (https://arxiv.org/html/2609.16906#bib.bib68); Porter and Wood, 2021 (https://arxiv.org/html/2609.16906#bib.bib70))。在NLP中,仅少数工作明确建模或生成针对隐含刻板印象的回复,研究不同的反驳策略并评估其有效性(Fraser et al., 2021 (https://arxiv.org/html/2609.16906#bib.bib31); Fraser et al., 2023 (https://arxiv.org/html/2609.16906#bib.bib6); Mun et al., 2023 (https://arxiv.org/html/2609.16906#bib.bib7); Allaway et al., 2023 (https://arxiv.org/html/2609.16906#bib.bib8); Nejadgholi et al., 2024 (https://arxiv.org/html/2609.16906#bib.bib32)),使得稳健的反刻板印象生成尚未被探索。  

总体而言,尽管在刻板印象检测和CS生成方面取得了显著进展,但针对仇恨信息潜在隐含刻板印象的基于LLM的CS生成研究相对较少。  

## 3 数据  
由于我们的研究聚焦于EN、ES和IT,我们扩展了多语言MT-CONAN-KN数据集(Bonaldi et al., 2025 (https://arxiv.org/html/2609.16906#bib.bib1)),该数据集扩展自MT-CONAN(Bonaldi et al., 2022 (https://arxiv.org/html/2609.16906#bib.bib3))。它包含针对多个受保护群体(包括女性、有色人种(POC)、移民、犹太人、穆斯林和LGBTQ+个体)的英语HS/CS对,并通过人工翻译扩展至多种语言,包括IT和ES。我们使用训练和开发集,因其包含人工标注者撰写的HS和金标CS回复,我们在评估中将其作为参考。总体而言,数据集包含每种语言496个HS/CS对,其中ES和IT的版本是源自英语源的人工翻译。  

表1:英语、西班牙语和意大利语数据集的标注者间一致性(IAA)。  
表2:标注摘要统计。  

### 3.1 标注维度  
每条HS信息沿四个维度进行标注:HS的隐含性、刻板印象的存在、归纳范围以及归因特质类型。最后两个维度仅对已识别出刻板印象的信息进行标注。  

**HS的隐含性**。我们标注HS是直接传达还是通过推理传达。当贬损意图通过预设、暗示、隐语或隐喻等手段间接表达时,HS被标记为隐性;当通过明确侮辱或不含歧义的贬损陈述传达时,被标记为显性。此维度独立于刻板印象的存在:信息可能包含显性仇恨,同时表达隐性的群体属性,反之亦然。  

**刻板印象的存在**。当可识别目标群体且分配了属性时,HS被标注为包含刻板印象……

相似文章

将LLM性别偏见锚定于人类基线:一项跨语言审计

arXiv cs.CL

本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。