一个用于有效反叙事生成与优化的多阶段代理框架
摘要
一个用于生成、优化和评估反叙事以对抗仇恨言论和错误信息的多阶段代理框架,人类验证显示其在说服力和安全性上优于专家撰写的反言论。
arXiv:2609.14178v1 公告类型:新
摘要:仇恨言论和错误信息在社交媒体上的迅速传播对民主社会构成挑战,因为直接的抑制努力可能会加深两极分化、加剧公众不信任并强化极端主义叙事。基于大语言模型的反叙事(CN)为减少这些风险提供了一种有前景的方式,但其有效性取决于尚未充分理解的修辞和风格选择。我们提出了一个基于代理的多阶段框架,用于生成、优化和评估反叙事,应用于亲俄的仇恨和错误信息叙事,特别是关于乌克兰战争的内容,并可适应其他领域。一项与人类评估者的初步实验确定了有效的技术和风格组合,例如重复与情感框架的结合增强了说服力。基于这些见解,我们引入了一个多代理优化过程,以迭代方式改进反叙事在说服力、情感参与和可分享性方面的表现。人类验证确认改进后,自动化安全分析显示我们优化的反叙事与专家撰写的反言论相当或更优。模拟实验表明,它们降低了亲俄叙事的感知强度,并始终优于基线大语言模型,突显了针对仇恨言论和错误信息的可扩展、特定叙事干预的途径。随本工作的代码和数据公开在 https://github.com/carmelkron/inlg2026-counter-narratives。
查看缓存全文
缓存时间: 2026/09/15 08:51
# 一种用于有效反叙述生成与精炼的多阶段代理框架 来源:https://arxiv.org/html/2609.14178 Carmel Kronfeld 隶属机构:特拉维夫大学工业与智能系统工程学院 邮箱:[carmelk@mail\.tau\.ac\.il](mailto:[email protected]) Sharva Gogawale 隶属机构:特拉维夫大学电气与计算机工程学院 邮箱:[sharvag@mail\.tau\.ac\.il](mailto:[email protected]) Tetsuro Kobayashi 隶属机构:早稻田大学政治经济学部 邮箱:[tkobayas@waseda\.jp](mailto:[email protected]) Irad Ben\-Gal 隶属机构:特拉维夫大学工业与智能系统工程学院 邮箱:[bengal@tau\.ac\.il](mailto:[email protected]) ###### 摘要 仇恨言论和虚假信息在社交网络上的快速扩散对民主社会构成挑战,因为直接的压制措施可能加深两极分化、加剧公众不信任,并强化极端主义叙事。由大语言模型(LLM)驱动的反叙述(CN)提供了一种有前景的方式来降低这些风险,但其有效性取决于尚不明确的修辞与风格选择。我们提出了一个多阶段的基于代理的框架,用于生成、精炼和评估反叙述,该框架适用于针对乌克兰战争的亲俄仇恨和虚假信息叙事,并可扩展到其他领域。一项由人类评估者参与的先导实验识别出了有效的技术-风格组合,例如将*重复*与*情感*框架相结合能增强*说服力*。基于这些发现,我们引入了一个多代理精炼流程,通过迭代改进反叙述以提升其说服力、情感参与度和可分享性。在人类验证确认改进效果后,一项自动安全分析显示,我们精炼后的反叙述与专家撰写的反制言论相当或更优。随后的一项模拟实验表明,这些反叙述降低了亲俄叙事的感知强度,并且始终优于一个基础LLM基线,这为实现针对仇恨言论和虚假信息的可扩展、叙事特异性干预指明了一条路径。随本文附带的代码和数据已公开发布于 https://github.com/carmelkron/inlg2026-counter-narratives 。 ## 1 引言 随着社交媒体在全球范围内的扩散,跨境宣传获得了前所未有的影响力。与早期依赖国家媒体或外交渠道的形式不同,当今的影响力行动遵循“参与式宣传”模式,叙事通过与国家相关的传播者、伪装账号、机器人,甚至充当次级传播者的普通用户进行扩散(Starbird 等,2019;Wanless 和 Berk,2022)。推动这一转变的关键因素是协调一致的虚假/错误信息操作的增长,这些操作大规模利用平台动态。通过机器人网络和虚假协调同步放大信号(例如点赞、分享和评论),它们可以操纵排名算法、制造共识假象并操纵公共话语;鉴于其严重性,世界经济论坛将错误信息和虚假信息列为最严重的近期全球风险,指出其危害包括两极分化和对机构信任的侵蚀(世界经济论坛,2024;世界经济论坛,2025)。这些行动的成功不仅在于散布谎言,还在于对注意力的优化:情感上激烈的信息往往比基于事实的信息更占上风(Xue 等,2025),而且许多说法即使毫无根据或属于阴谋论也仍然具有说服力(Kobayashi 等,2025)。与此同时,仇恨言论经常与虚假信息共同传播,使针对外群体的敌意正常化,并在某些情况下显示出与线下仇恨事件和暴力的可衡量联系(Castaño\-Pulgarín 等,2021;Arcila Calderón 等,2024)。最近的工作进一步表明,随着生成式AI能力的提升,在线叙事的说服力可能会增强。Hackenburg 等(2025)表明,LLM 可以通过战略性选择和构建信息来增强说服力,但这可能会降低事实准确性,使论点更具说服力但不够真实。此外,随着人工智能的发展,语言障碍减少,使得流畅的本地化信息传递成为可能,扩大了叙事的影响范围(Wack 等,2025)。自由主义叙事在国际冲突中扮演着特别重要的角色,因为对全球舆论的影响力可以塑造机构决议、谈判和联盟建立。相应地,冲突各方开展了广泛的社交媒体行动,包括在俄罗斯-乌克兰背景下。实证研究证明,机器人和自动账户在这些叙事传播的早期阶段发挥了关键作用(Geissler 等,2023)。 总而言之,虚假信息和充满仇恨、情感激烈的叙事的快速传播带来了重大挑战,然而在民主社会中,直接的国家干预是困难的:在线审查可能破坏言论自由,压制与特定政治立场相关的言论可能加深两极分化、加剧不信任并强化极端主义叙事。因此,反叙述(CN)作为一种在不依赖审查等直接干预的情况下保护民主和自由公共领域的方式,受到了关注。反叙述通过重新构建叙事来减少其说服力和情感影响力,超越了事实核查(Cipers 等,2023)。更广泛地说,近期的防御工作将此类行动视为“认知战”,并强调缓解和社会韧性,而不是仅仅依赖下架,这激励了诸如反叙述这类可扩展的“以言论对抗言论”的干预措施(Blatny 和 Søndergaard,2025)。然而,手动创建反叙述速度慢且费力,限制了其可扩展性(Schieb 和 Preuss,2016),这推动了基于LLM的自动化反叙述生成,尽管对于哪些风格和修辞策略最为有效我们知之甚少。 我们通过提出一个统一反叙述生成、精炼和评估的多阶段基于代理的框架来填补这些空白,以实现可扩展的、针对特定叙事的干预。我们的贡献如下: - • 一个混合的人类-AI流水线,整合了自动化的反叙述生成、精炼和评估,如图1所示。 - • 一项与人类评估者合作的先导研究,研究哪些*修辞技巧*和*写作风格*对反叙述生成最有效。 - • 一个旨在通过有效利用最佳技术-风格组合来改进反叙述生成的多代理精炼系统,显示出明显的改进,并通过人类评估者验证,并且在评估的自动有害语言指标方面与专家撰写的反制言论相当。 - • 一项模拟实验表明,我们精炼后的反叙述在降低目标叙事有效性方面优于基础LLM基线。 虽然我们的案例研究集中在有害且误导性的亲俄叙事上,但该框架可推广到其他领域,强调了其在可扩展的、由LLM驱动的反叙述开发方面的广泛潜力。 ## 2 相关工作 #### 反叙述生成 “以更多言论对抗仇恨言论”的策略(Bielefeldt 等,2011)是反制言论(counter-speech)和反叙述(counter-narratives)的基础,两者在自然语言处理(NLP)中常被视为同义词,但在社会科学中有所区分(Benesch 等,2016)。早期工作侧重于数据整理,从社交媒体(Mathew 等,2019)和专家回复(Chung 等,2019)构建数据集,后来扩展到包含多目标、人在回路(human-in-the-loop)的流水线(Fanton 等,2021)。这些使得早期的生成方法如“生成-剪枝-选择”(Zhu 和 Bhat,2021)得以发展。反制言论能够改变规范的证据(Schieb 和 Preuss,2016)促使使用LLM来创建更具说服力、基于证据的反叙述。事实性问题已通过强化学习奖励(F2RL,Wang 等,2024a)、检索增强(ReZG,Jiang 等,2024)和注意力正则化(Bonaldi 等,2023)得到解决。策略控制利用了意图条件(例如同理心、谴责),如DART中的双重判别器(Wang 等,2024b),以及基于偏好的调整(如DPO)以提高事实性和多语言鲁棒性(Wadhwa 等,2025)。论证信息(Furman 等,2023)和个性化(Doğanç 和 Markov,2023)也提升了反叙述质量。通过分析不可信文本的语言特征,Rashkin 等(2017)证明了风格线索能系统地区分宣传和骗局与可靠新闻。在计算论证生成领域,Alshomary 等(2021)引入了多阶段流水线,首先识别薄弱前提,然后生成针对性的反驳论点,而Alshomary 等(2022)探索了使用道德框架的风格条件说服。最近的研究探索了提示策略(Jeong 等,2025;Saha 等,2024)、情感框架(Russo 等,2023)和现实世界部署,例如针对乌克兰难民的仇恨(Podolak 等,2024)。风险依然存在,正如Bär 等(2024)警告LLM反制言论可能因放大有害叙事而适得其反。应用现已从仇恨言论扩展到虚假信息,使用论证图框架中的控制代码(Saha 和 Srihari,2024)和可扩展的基于事实的生成(Xu 等,2025)。 总体而言,该领域已从基于策划数据的流水线转向LLM生成更安全、针对特定上下文的反叙述。 #### 使用LLM的说服 研究表明,较新的LLM表现出强大的说服能力,能产生与人类撰写的论点相媲美的论点(Durmus 等,2024)。它们实现了个性化说服的规模化(Matz 等,2024),在具有社会人口学信息访问的控制辩论中超越人类(Salvi 等,2025),甚至在用户知道他们正在与AI互动的自然对话中也能改变观点(Havin 等,2025)。说服力不仅与论点质量有关,还与复制细微沟通意图的能力相关(Dönmez 和 Falenska,2025)。为了推进这些系统,Jin 等(2024)引入了DailyPersuasion和PersuGPT,将意图到策略的推理与优化相结合,而Karande 等(2024a)提出了一个多代理架构,具有用于策略和事实核查的辅助代理。这些方法增强了有效性,并在宣传(Karande 等,2024b)和影响极化的政治态度(Bai 等,2025)方面显示了应用。 然而,这些新方法也带来了重大风险。例如,Liu 等(2025)警告LLM可能成为危险的说服者,而Bozdag 等(2025)强调系统评估说服效果和易感性。总之,这些工作凸显了说服性LLM的前景与危险。 #### 反叙述评估 评估反叙述具有挑战性,因为传统的基于参考的指标与人类判断相关性差,且忽略了连贯性和上下文相关性等特质。这导致了向基于LLM的无参考评估的转变。一个范式将质量分解为以人为中心的维度。Jones 等(2024)根据五个受NGO启发的方面对反叙述进行评分,与人类注释一致;CSEval(Hengle 等,2025)应用自校准的思维链(Chain-of-Thought)评估四个维度,包括攻击性和适用性;Song 等(2025)增加了“类人性”以评估自然度;而CheckEval(Lee 等,2025)通过检查表驱动的测试对评估者施压。第二个范式依赖于比较排序。Zubiaga 等(2024)引入了一个锦标赛流水线,其中LLM判断者对反叙述进行成对排名,实现了与人类判断的强相关性。扩展评估则评估了说服力和事实性,为生成精炼提供了更丰富的反馈(Wilk 等,2025)。 ## 3 先导实验 我们的先导研究映射了哪些*修辞技巧*和*写作风格*对构建针对突出亲俄叙事的反叙述最有效。我们(i)从亲俄的Twitter/X话语中提取代表性的基础主张;(ii)通过交叉13种修辞技巧与10种风格系统地生成反叙述;(iii)在三个关键绩效指标(KPI)上获得人类判断:*说服力*、*情感参与度*和*可分享性*。技术分类法遵循先前研究(Chernyavskiy 等,2024;Da San Martino 等,2019;Salman 等,2023)。用于生成的提示在附录A中逐字提供,评估界面显示在附录B中。 ### 3.1 亲俄基础主张的提取 2024年4月,与XPOZ合作,我们收集了包含反映常见虚假信息套路和针对乌克兰的仇恨煽动性框架关键词的英语推文(例如“乌克兰战争罪行”和“乌克兰纳粹”),时间跨度为检索前最多120天。在过滤噪声(例如离题内容)后,我们对……
相似文章
在仇恨言论与错误信息交汇处的辅助性反言论写作
本文研究在仇恨言论与错误信息同时出现时,利用大型语言模型辅助专家撰写反言论,通过人工评估测试了知识驱动策略。结合事实核查员与非政府组织指南的混合策略被证明最为有效。
解构刻板印象:用于有效多语言反驳言论的范围条件生成
本文提出一种新的范围条件生成框架,该框架将结构化刻板印象特征整合到大型语言模型提示中,以实现有效的多语言反驳言论,并在一个由人工整理的数据集上验证,显示在事实性和有效性方面有显著提升。
CAF-Gen:一种用于丰富论证结构的多智能体系统
CAF-Gen是一个基于多智能体LLM的框架,通过迭代的创作者-评审者流水线,将浅层论证结构丰富为正式的Carneades论证框架模型,从而提高了结构对齐性和质量。
使用多LLM代理模拟仇恨言论级联:经验基础、建模保真度与干预策略
本文研究了Bluesky上的仇恨言论级联,并使用多LLM代理进行模拟,发现此类模拟再现了立场单一文化和毒性增量方向等关键模式,且在密集网络上进行放大器定位可使仇恨内容减少7.5%–12.9%,且良性副作用较低。
潜在智能体:一种内化多智能体辩论的后训练方法
波士顿大学的研究人员提出了 IMAD(内化多智能体辩论),这是一个两阶段微调框架,能够将多智能体辩论过程提炼至单个 LLM 中,在匹配甚至超越显式多智能体辩论性能的同时,实现最高 93% 的 token 用量缩减。该研究还揭示了激活空间中存在特定于智能体的子空间,从而可以对内化推理行为进行有效控制,包括抑制恶意智能体的影响。