在仇恨言论与错误信息交汇处的辅助性反言论写作

arXiv cs.CL 论文

摘要

本文研究在仇恨言论与错误信息同时出现时,利用大型语言模型辅助专家撰写反言论,通过人工评估测试了知识驱动策略。结合事实核查员与非政府组织指南的混合策略被证明最为有效。

arXiv:2605.22435v1 公告类型:新 摘要:仇恨言论和错误信息经常在网上同时出现,加剧了偏见和两极分化。鉴于其规模,使用大型语言模型(LLMs)辅助专家撰写反言论(CS)已引起关注,但先前的研究分别处理这些现象。我们通过研究在仇恨和错误信息同时出现的背景下生成CS来弥补这一差距。我们测试了三种知识驱动的生成策略:首先,我们向LLM提供事实核查员的指南和事实核查文章;其次,提供非政府组织的指南和报告;第三,我们创建了一种混合策略,结合了双方的指南和文件。23位专家对生成的CS进行修订,并通过人工和自动指标进行评估。虽然LLM在40%的情况下生成了足够的CS,但专家的编辑显著提高了自然性、详尽性和对指南的遵循程度。基于后期编辑的CS,混合策略在众包评估中被证明最为有效,将强力的事实纠正与减少刻板印象和共情参与相结合。我们发布了一个包含仇恨和错误信息言论的数据集,以及经过专家验证的CS和支持知识。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:47

# 仇恨言论与虚假信息交叉点的辅助性反言论写作 来源:https://arxiv.org/html/2605.22435 Genoveffa Martone¹,² Helena Bonaldi¹ Marco Guerini¹ ¹意大利布鲁诺·凯斯勒基金会,²意大利圣心天主教大学,\{gmartone, hbonaldi, guerini\}@fbk\.eu ###### 摘要 仇恨言论和虚假信息经常在网上同时出现,加剧偏见和两极分化。鉴于其规模,使用大型语言模型(LLMs)来辅助专家进行反言论(CS)写作已引起关注,但先前的研究是分别处理这些现象的。我们通过研究在仇恨和虚假信息同时出现的背景下生成反言论,来弥合这一差距。我们测试了三种知识驱动的生成策略:首先,我们用事实核查员的指南和事实核查文章来提示LLM;其次,用非政府组织的指南和报告;第三,我们创建了一种混合策略,结合了来自两者的指南和文件。23位专家修改了生成的反言论,并通过人工和自动指标进行评估。虽然LLMs在40%的情况下产生了足够的反言论,但专家的编辑显著改善了自然度、详尽性和对指南的遵循。基于后期编辑的反言论,混合策略在众包评估中被证明是最有效的,将强有力的事实纠正与刻板印象缓解和共情参与相结合。我们发布了一个包含仇恨和虚假信息言论的数据集,附有专家验证的反言论和支持性知识。 仇恨言论与虚假信息交叉点的辅助性反言论写作 Genoveffa Martone¹,² Helena Bonaldi¹ Marco Guerini¹ ¹意大利布鲁诺·凯斯勒基金会,²意大利圣心天主教大学,\{gmartone, hbonaldi, guerini\}@fbk\.eu,警告:本文包含一些读者可能会觉得冒犯的未掩盖示例。 ## 1 引言 仇恨言论和虚假信息正渗透互联网空间,这些现象常常相互交织Cazzamatta (2025 (https://arxiv.org/html/2605.22435#bib.bib8)):仇恨言论、激进攻击和党派言论比准确内容更频繁地与虚假信息一起出现Hameleers et al. (2022 (https://arxiv.org/html/2605.22435#bib.bib24))。此外,接触虚假信息会加剧现有的偏见和歧视,导致对边缘化群体的仇恨增加。这种毒性协同效应放大了它们的整体影响,削弱了社会信任,加剧了两极分化和分裂Kim et al. (2024 (https://arxiv.org/html/2605.22435#bib.bib28))。在这种背景下,反言论(CS)已成为一种有前景的策略,可以分别应对在线仇恨和虚假信息。尽管这些现象相互关联,但它们主要由不同的专业人员遵循不同的指南分别处理。一方面,针对仇恨的反言论包括共情性回复,旨在通过有力的理由和基于事实的论据来对抗仇恨内容Schieb and Preuss (2016 (https://arxiv.org/html/2605.22435#bib.bib48)),通常由非政府组织运营者撰写。另一方面,针对虚假信息的反言论通常被称为裁决,是以无党派、非情绪化风格撰写的简短文本,旨在证明陈述的真实性Guo et al. (2022 (https://arxiv.org/html/2605.22435#bib.bib23)),可由事实核查员生产Wintersieck (2017 (https://arxiv.org/html/2605.22435#bib.bib55))。鉴于在线仇恨和虚假信息的规模,使用大型语言模型(LLMs)来自动化或协助专家撰写针对这些现象的反言论已引起越来越多的兴趣,尽管先前的研究大多分别处理它们Chung et al. (2021b (https://arxiv.org/html/2605.22435#bib.bib11)); Mun et al. (2024 (https://arxiv.org/html/2605.22435#bib.bib35)); Zeng and Gao (2024a (https://arxiv.org/html/2605.22435#bib.bib56)); Russo et al. (2025a (https://arxiv.org/html/2605.22435#bib.bib44))。为弥补这一差距,我们认识到它们的相互关联并共同处理它们,研究针对仇恨和虚假信息同时出现的反言论在多大程度上可以自动化,以及哪种策略最有效地整体处理这些现象。首先,我们收集专家撰写的指南,这些指南分别由非政府组织和事实核查员使用,以对抗在线仇恨和虚假信息,并考虑超过2000篇事实核查文章和280份非政府组织报告作为外部知识。然后将收集的知识和指南作为输入提供给一个商业LLM,以三种生成配置生成知识驱动的反言论:1)非政府组织策略,遵循通常用于对抗在线仇恨的非政府组织指南,并采用非政府组织撰写的反刻板印象报告作为外部知识;2)事实核查员策略,遵循欧洲独立事实核查组织标准准则,¹¹¹https://efcsn.com/code-of-standards/ 并使用事实核查文章作为外部知识;3)混合策略,我们制定了一套新的指南,专门旨在处理仇恨和虚假信息的结合,并使用两种类型的文件作为外部知识。图1 (https://arxiv.org/html/2605.22435#S1.F1) 展示了一个包含虚假信息的仇恨言论示例以及使用三种策略获得的反言论。在我们的研究中,我们与来自4个国家7个组织的23名非政府组织运营者和事实核查员合作,他们都是反言论写作方面的专家,通过检查对各自指南的遵循、所提供信息的详尽性以及文本的自然度,来修改使用三种策略生成的反言论。事实上,尽管LLMs最近取得了重大进展,但先前的研究表明,它们通常会生成模糊的反言论,主要谴责仇恨内容而不直接与之接触,并且依赖于重复的、听起来不自然的模式Tekiroğlu et al. (2020 (https://arxiv.org/html/2605.22435#bib.bib50)); Bonaldi et al. (2024b (https://arxiv.org/html/2605.22435#bib.bib7)); Mun et al. (2023 (https://arxiv.org/html/2605.22435#bib.bib34))。在没有任何人类监督的情况下部署此类模型的另一个主要担忧是产生有害或不准确内容的风险Bonaldi et al. (2024a (https://arxiv.org/html/2605.22435#bib.bib6))。因此,我们对生成的和后期编辑的对进行自动和人工评估,以通过RQ1评估其质量:LLM在多大程度上可以协助专业人员制作针对仇恨和虚假信息的反言论?我们发现,虽然在40%的情况下不需要标注者,但他们的编辑改善了自然度和详尽性,更好地符合专家指南,并消除了由于模型对事实核查员和非政府组织角色的刻板印象而导致的重复模式。然后我们保留后期编辑的反言论(自动和人工指标都偏好),并通过广泛的人工评估比较三种策略来回答RQ2:哪种策略最有效地应对仇恨和虚假信息的结合?我们的混合策略独特地将事实核查员方法在纠正事实不准确方面的效果与非政府组织方法在缓解刻板印象和培养共情方面的效果相匹配。我们的流水线概览如图2 (https://arxiv.org/html/2605.22435#S1.F2) 所示。我们的数据集包括324个针对六个边缘化群体的仇恨和虚假信息陈述示例,以及生成的和专家后期编辑版本的反言论及支持性外部知识,可在以下链接获取:https://github.com/LanD-FBK/counterspeech_against_hate_and_misinfo。 参考图注图1:一个包含虚假信息的仇恨言论示例以及使用三种测试策略获得的反言论。橙色突出显示的文本代表与虚假信息相关的文本,而浅蓝色代表与仇恨相关的文本。 参考图注图2:本工作的流水线:首先,收集外部知识和指南。然后,将它们作为输入以三种策略生成反言论。生成的反言论由专家后期编辑,最后通过自动和人工评估进行评估。 ## 2 相关工作 #### 针对仇恨的反言论 近年来,对自动化生产针对仇恨的反言论的兴趣日益增长Bonaldi et al. (2024a (https://arxiv.org/html/2605.22435#bib.bib6))。虽然部分研究依赖于网络上可用的反言论数据Mathew et al. (2019 (https://arxiv.org/html/2605.22435#bib.bib32)); Vidgen et al. (2020 (https://arxiv.org/html/2605.22435#bib.bib53)); Albanyan et al. (2023 (https://arxiv.org/html/2605.22435#bib.bib1))或合成获得的数据Ashida and Komachi (2022 (https://arxiv.org/html/2605.22435#bib.bib2)); Vallecillo-Rodríguez et al. (2023 (https://arxiv.org/html/2605.22435#bib.bib52)),其他研究则涉及人类专业人员在指南定义和数据收集方面的参与Chung et al. (2019 (https://arxiv.org/html/2605.22435#bib.bib9)); Fanton et al. (2021 (https://arxiv.org/html/2605.22435#bib.bib16))。总的来说,语言模型在生成类似人类的反仇恨言论方面显示出反复出现的问题,这些问题可以通过人类干预来缓解。特别是,自动获得的反言论往往缺乏具体性和说服力Tekiroğlu et al. (2020 (https://arxiv.org/html/2605.22435#bib.bib50)); Bonaldi et al. (2024b (https://arxiv.org/html/2605.22435#bib.bib7)),泛泛地谴责仇恨言论中呈现的刻板印象而不直接处理它们Mun et al. (2023 (https://arxiv.org/html/2605.22435#bib.bib34))。许多研究试图通过针对生成的特定方面(如其个性化(de los Riscos and D’Haro,2021 (https://arxiv.org/html/2605.22435#bib.bib13); Doğanç and Markov,2023 (https://arxiv.org/html/2605.22435#bib.bib14); Cima et al.,2025 (https://arxiv.org/html/2605.22435#bib.bib12))和论证说服力Furman et al. (2023 (https://arxiv.org/html/2605.22435#bib.bib19)); Bonaldi et al. (2024b (https://arxiv.org/html/2605.22435#bib.bib7))来获得更接近人类质量的反言论。最后,还探索了生成更具信息量的反言论,特别是通过知识引导的生成,其中知识首先自动检索,然后用于生成反言论Chung et al. (2021a (https://arxiv.org/html/2605.22435#bib.bib10)); Jiang et al. (2025 (https://arxiv.org/html/2605.22435#bib.bib26)); Russo (2025 (https://arxiv.org/html/2605.22435#bib.bib42))。 #### 针对虚假信息的反言论 同样,关注针对虚假信息的反言论生成的研究也可以涉及人类专业知识Russo et al. (2023a (https://arxiv.org/html/2605.22435#bib.bib43)); He et al. (2023 (https://arxiv.org/html/2605.22435#bib.bib25))。关键评估方面包括可读性,即反言论的可理解程度;可信度,表明反言论的说服力;忠实性,即反言论准确反映模型推理的程度(Guo et al.,2022 (https://arxiv.org/html/2605.22435#bib.bib23))。虽然早期方法采用注意力Popat et al. (2018 (https://arxiv.org/html/2605.22435#bib.bib40))和基于规则的技术Gad-Elrab et al. (2019 (https://arxiv.org/html/2605.22435#bib.bib20)),但目前最常用的方法包括摘要Atanasova et al. (2020 (https://arxiv.org/html/2605.22435#bib.bib3)); Kotonya and Toni (2020 (https://arxiv.org/html/2605.22435#bib.bib30)); Russo et al. (2023a (https://arxiv.org/html/2605.22435#bib.bib43),b (https://arxiv.org/html/2605.22435#bib.bib46))、提示Russo et al. (2025b (https://arxiv.org/html/2605.22435#bib.bib45))和检索增强生成(Zeng and Gao,2024b (https://arxiv.org/html/2605.22435#bib.bib57); Russo et al.,2025a (https://arxiv.org/html/2605.22435#bib.bib44))。 #### 针对仇恨和虚假信息的反言论 虽然针对仇恨和虚假信息的反言论生成都被NLP社区视为独立任务,但针对这两种现象同时发生时进行解决的研究有限。Lisker et al. (2025 (https://arxiv.org/html/2605.22435#bib.bib31))专注于针对阴谋论的反言论生成,其中仅一小部分包含仇恨言论(17个示例,即11%)。此外,即使作者尝试了“基于事实”的反言论策略,他们在生成反言论时也没有向语言模型提供外部知识,从而获得了通常包含捏造信息的通用回复。Saha and Srihari (2024 (https://arxiv.org/html/2605.22435#bib.bib47))则专注于采用针对仇恨的反言论策略来对抗虚假信息,但没有解决它们的重叠问题。 ## 3 方法论 本节概述我们的方法。我们首先收集模型推理的指南和外部知识,然后描述仇恨和虚假信息言论的创建、三种反言论生成策略,以及用于修改生成结果的专家标注过程。排除专家标注,反言论生成前阶段涉及许多手动步骤:指南整理、外部知识准备和言论创建,大约需要5人月的工作量。 ### 3.1 指南收集 作为第一步,我们草拟如何按照事实核查员、非政府组织和混合策略获取反言论的指南。这些指南有两个目的:指导模型并为专家标注者提供统一的参考,减少其组织间的微小差异。所有指南在开始标注前都经过标注者验证。提供给标注者的完整指南见附录A.1 (https://arxiv.org/html/2605.22435#A1.SS1)。 #### 事实核查员指南 关于事实核查员策略,指南源自欧洲独立事实核查组织标准准则。具体而言,该准则强调事实核查应侧重于可验证的事实和统计数据,明确引用所查阅的来源,优先选择一手来源而非二手来源,并以精确、无党派、非情绪化的语言呈现结果。 #### 非政府组织指南 关于非政府组织策略,我们采用“赶走巨魔”项目指南,²²²https://getthetrollsout.org/stoppinghate 该指南强调了采用礼貌和友善语气的重要性,攻击信息而非撰写信息的人,避免使用分裂性语言(例如“法西斯”、“无知”),理解可能构成仇恨表达基础的恐惧或焦虑,并用替代观点和证据挑战有害的刻板印象。 #### 混合指南 事实核查员和非政府组织的指南有一些重叠特征。例如,在这两种情况下,都期望有礼貌、流畅且相关的反言论He et al. (2023 (https://arxiv.org/html/2605.22435#bib.bib25)); Russo et al. (2023a (https://arxiv.org/html/2605.22435#bib.bib43))。同时,也存在一些差异:例如,事实核查员的指南强调以精确、无党派、非情绪化的语言呈现事实。另一方面,在对抗仇恨言论时,非政府组织指南强调理解可能构成仇恨表达基础的恐惧或焦虑的重要性。为了结合这两种方法,我们与专家标注者合作开发了一套新的指南,寻求这些观点之间的平衡。关于干预的风格,一方面,强调了事实核查员基于证据的方法,突出了依赖可信来源的重要性。另一方面,根据非政府组织的建议,鼓励表达对目标群体的支持。

相似文章

潜在事实核查:通过激活工程检测错误信息

arXiv cs.LG

本文介绍了一种基于激活工程的错误信息检测框架,将最后一个token的激活投影到LLM残差流中学习到的“虚假方向”上。研究在Gemma、Llama和Qwen模型上进行了事实核查基准评估,表明真实性在潜在空间中是线性可分的。

当虚假信息发声与对话:重塑音频平台的事实核查机制

arXiv cs.CL

# 当虚假信息发声与对话:重塑音频平台的事实核查机制 来源:[https://arxiv.org/abs/2604.16767](https://arxiv.org/abs/2604.16767) [查看PDF](https://arxiv.org/pdf/2604.16767) > 摘要:音频平台已超越娱乐范畴。它们已成为公众话语的核心,从播客、广播到WhatsApp语音留言和直播无处不在。凭借数百万档节目与数亿听众,音频平台如今已成为虚假信