使用多LLM代理模拟仇恨言论级联:经验基础、建模保真度与干预策略
摘要
本文研究了Bluesky上的仇恨言论级联,并使用多LLM代理进行模拟,发现此类模拟再现了立场单一文化和毒性增量方向等关键模式,且在密集网络上进行放大器定位可使仇恨内容减少7.5%–12.9%,且良性副作用较低。
arXiv:2606.18264v1 Announce Type: cross
摘要:对在线平台上仇恨内容传播的忠实建模仍是审核研究中的一个开放问题。经典级联模型未明确表示与仇恨内容传播相关的用户档案、社区和内容因素,在真实场景中部署时可能导致审核策略效果不佳。多智能体大语言模型(LLM)系统原则上可使每次转发决策依赖于用户档案、周边社区和帖子内容,但尚不清楚这种增加的灵活性是否比经典基线更忠实地再现真实的仇恨级联。我们研究了三个仇恨性Bluesky级联和一个规模匹配的良性对照。在经验性的Bluesky数据中,我们发现:97.4%–99.7%的转发者采取敌对立场;对仇恨级联而言,扩散树上的毒性-参与同质性高于关注者图;仇恨级联的拓扑结构呈星形(大多数转发直接来自根节点),而良性级联呈树形(转发通过多跳链传播)。在模拟中,多LLM代理模拟器再现了立场单一文化和毒性增量方向。结构化消融实验将代理异质性确定为主要的保真度因素,且在密集网络上进行放大器定位可在5.7%良性副作用下实现7.5%–12.9%的减少。
查看缓存全文
缓存时间: 2026/06/18 05:43
# 使用多智能体大语言模型模拟仇恨言论级联:实证基础、建模保真度与干预策略 来源:https://arxiv.org/html/2606.18264 ###### 摘要 对在线平台上仇恨内容传播进行忠实建模,仍然是审核研究中的一个开放问题。经典的级联模型没有显式表示与仇恨内容传播相关的用户画像、社区和内容因素,由此产生的审核策略在现实场景中部署时可能效果不佳。多智能体大语言模型(LLM)系统原则上可以使每一次转发决策都依赖于用户画像、周围社区和帖子内容,但目前尚不清楚这种增加的灵活性是否比经典基线模型更忠实地再现了真实的仇恨级联。我们研究了三个仇恨性的 Bluesky 级联以及一个规模匹配的良性对照。在实证的 Bluesky 数据中,我们发现:97.4–99.7% 的转发者持敌对立场;在仇恨级联中,毒性-参与同质性在传播树上高于关注者图;仇恨级联的拓扑结构是星形的(大多数转发直接来自根节点),而良性级联的拓扑结构是树形的(转发通过多跳链传播)。在模拟中,多LLM智能体模拟器重现了立场单一文化和毒性差异方向。一个结构化的消融实验确定智能体异质性为主要的保真度因素,而在密集网络上针对放大器进行干预,在 5.7% 的良性附带损害下实现了 7.5–12.9% 的减少。 使用多LLM智能体模拟仇恨言论级联:实证基础、建模保真度与干预策略 黄凡印第安纳大学布鲁明顿分校[email protected] 请参见图例图1:端到端研究流程。顶部:Bluesky 数据收集(开始日期:2026年1月1日;结束日期:2026年4月12日;102天窗口),两遍 GPT-4o-mini 然后 GPT-4o 主题发现,以及每个级联的网络和属性构建。中部:在相同构建的级联上提出的三个并行研究问题,每个问题附有一个核心发现。底部:三个轨道汇聚于基于模拟的干预假设。 ## 1 引言 社交媒体上的仇恨言论与线下危害相关联,从目标群体的心理困扰到基于种族和宗教的犯罪率上升 (Williamset al.,2020 (https://arxiv.org/html/2606.18264#bib.bib27);Müller and Schwarz,2021 (https://arxiv.org/html/2606.18264#bib.bib12)),且病毒式传播的有毒内容会影响到远不止单一社区的受众 (Mathewet al.,2019 (https://arxiv.org/html/2606.18264#bib.bib10);Matamoros-Fernández and Farkas,2021 (https://arxiv.org/html/2606.18264#bib.bib26))。因此,平台面临一个反复出现的问题:仇恨内容如何通过关注者网络传播,以及哪些干预措施能在不抑制良性互动的情况下抑制它? 对这个问题的模拟必须捕捉:谁根据画像和社区上下文进行转发,这些决策如何聚合为级联结构,以及同一人群对候选审核策略如何反应。经典级联模型(独立级联 (Kempeet al.,2003 (https://arxiv.org/html/2606.18264#bib.bib9)),线性阈值 (Granovetter,1978 (https://arxiv.org/html/2606.18264#bib.bib8)))将转发视为固定规则的随机事件,并未表示这些因素。用作条件化智能体的大语言模型(LLM)原则上可以表达这些因素 (Parket al.,2023 (https://arxiv.org/html/2606.18264#bib.bib13);Argyleet al.,2023 (https://arxiv.org/html/2606.18264#bib.bib22);Hortonet al.,2023 (https://arxiv.org/html/2606.18264#bib.bib23);Ziemset al.,2024 (https://arxiv.org/html/2606.18264#bib.bib24);Gaoet al.,2024 (https://arxiv.org/html/2606.18264#bib.bib6)),但尚不清楚它们是否比更简单的基线模型更忠实地再现真实的仇恨级联。 实证工作描述了真实平台上级联的规模、深度和病毒式传播特征 (Vosoughiet al.,2018 (https://arxiv.org/html/2606.18264#bib.bib19);Goelet al.,2016 (https://arxiv.org/html/2606.18264#bib.bib7)),仇恨言论文献记录了仇恨用户特征 (Ribeiroet al.,2018 (https://arxiv.org/html/2606.18264#bib.bib20))、回音室放大效应 (Sasaharaet al.,2021 (https://arxiv.org/html/2606.18264#bib.bib16))、级联重尾分布 (Mathewet al.,2019 (https://arxiv.org/html/2606.18264#bib.bib10))、封禁效果 (Chandrasekharanet al.,2017 (https://arxiv.org/html/2606.18264#bib.bib3)) 以及线下事件耦合 (Olteanuet al.,2018 (https://arxiv.org/html/2606.18264#bib.bib28))。警示标签研究既报告了预期的减少效果 (Mena,2020 (https://arxiv.org/html/2606.18264#bib.bib11);Claytonet al.,2020 (https://arxiv.org/html/2606.18264#bib.bib4)),也报告了隐含真相的反效果 (Pennycooket al.,2020 (https://arxiv.org/html/2606.18264#bib.bib15))。另一条研究线索评估 LLM 智能体作为社会模拟方法 (Parket al.,2023 (https://arxiv.org/html/2606.18264#bib.bib13);Törnberget al.,2023 (https://arxiv.org/html/2606.18264#bib.bib17);Bail,2024 (https://arxiv.org/html/2606.18264#bib.bib2);Gaoet al.,2024 (https://arxiv.org/html/2606.18264#bib.bib6);Ziemset al.,2024 (https://arxiv.org/html/2606.18264#bib.bib24))。 这些文献在很大程度上是脱节的:实证级联研究很少在相同的观测网络上评估生成式模拟器;LLM智能体论文很少针对仇恨言论任务与经典级联基线进行基准测试;而审核策略也很少在机制感知的智能体响应模型下进行测试。因此,多LLM智能体模拟是否能提供可测量的保真度提升、哪些机制驱动了任何提升,以及在考虑机制后支持哪些干预措施,这些问题仍然悬而未决。 本文围绕三个研究问题展开。RQ1:现实世界的仇恨级联具有哪些结构性、时间性和社区层面的规律,它们与规模匹配的良性对照有何不同?RQ2:在相同网络上,多LLM智能体模拟器相对于经典扩散模型和更简单的LLM基线,能在多大程度上再现这些规律?RQ3:哪些智能体层面的机制解释了保真度差异,以及哪些审核策略得到了模拟驱动的反事实支持? 我们的贡献包括:(1) 对2026年1月至4月的三个Bluesky仇恨级联及一个规模匹配的良性对照,进行了每个级联的实证特征描述,并对每个级联报告了自助法置信区间,而非聚合值;(2) 在相同观测网络上,将多LLM智能体模拟器与经典扩散模型、行为模型及更简单的LLM基线进行保真度比较,结果显示在固定人群下,多LLM智能体是唯一能够区分仇恨内容与良性内容的受试系列;(3) 一个结构化消融实验,其中智能体异质性在测试条件下产生了最大的毒性差异偏移;(4) 基于模拟的反事实测试了四种审核策略,结果显示在我们的模拟中警示标签扩大了仇恨级联(与隐含真相效应一致),而在密集网络上针对放大器进行干预,在四种策略中展现了最有利的仇恨减少与良性附带损害之间的权衡;(5) 一个提示框架观察:概率预测减少了我们测试的、经过RLHF对齐的基座上使用角色扮演提示时所观察到的角色对齐拒绝。图1 (https://arxiv.org/html/2606.18264#S0.F1) 总结了研究流程。 ## 2 相关工作 ### 经典级联模型。 网络上的信息扩散通常使用独立级联(IC)模型 (Kempeet al.,2003 (https://arxiv.org/html/2606.18264#bib.bib9)) 进行建模,其中每条边 (u,v) 以概率 p_{uv} 独立激活;以及线性阈值(LT)模型 (Granovetter,1978 (https://arxiv.org/html/2606.18264#bib.bib8)),其中当活跃邻居的加权比例超过节点特定阈值时,节点被激活。流行病学风格的 SIR/SIS 模型已被用作信息传播的相关抽象 (Pastor-Satorraset al.,2015 (https://arxiv.org/html/2606.18264#bib.bib14))。这些方法可解释且可扩展,但它们将内容、画像和社区上下文压缩为单一的传播概率,这限制了它们表达与仇恨言论扩散相关的内容条件动态的能力。 ### 实证在线级联。 实证研究描述了在线级联的规模、深度和结构病毒性 (Vosoughiet al.,2018 (https://arxiv.org/html/2606.18264#bib.bib19);Goelet al.,2016 (https://arxiv.org/html/2606.18264#bib.bib7)),记录了算法排名如何影响社交平台上的意识形态曝光度 (Bakshyet al.,2015 (https://arxiv.org/html/2606.18264#bib.bib1)),并检查了行为在可观测网络中的实验性传播 (Centola,2010 (https://arxiv.org/html/2606.18264#bib.bib25))。我们遵循这种测量风格,并将其扩展到仇恨言论内容,并在同一平台上使用匹配的良性对照。 ### 仇恨言论动态与审核。 早期工作记录了检测方法和数据集差距 (Davidsonet al.,2017 (https://arxiv.org/html/2606.18264#bib.bib21);Fortuna and Nunes,2018 (https://arxiv.org/html/2606.18264#bib.bib5);Vidgen and Derczynski,2020 (https://arxiv.org/html/2606.18264#bib.bib18))、Twitter上的仇恨用户特征 (Ribeiroet al.,2018 (https://arxiv.org/html/2606.18264#bib.bib20))、回音室的作用 (Sasaharaet al.,2021 (https://arxiv.org/html/2606.18264#bib.bib16))、仇恨言论级联的重尾分布 (Mathewet al.,2019 (https://arxiv.org/html/2606.18264#bib.bib10))、社区封禁的平台级效果 (Chandrasekharanet al.,2017 (https://arxiv.org/html/2606.18264#bib.bib3))、在线仇恨暴露与线下犯罪之间的关联 (Müller and Schwarz,2021 (https://arxiv.org/html/2606.18264#bib.bib12);Williamset al.,2020 (https://arxiv.org/html/2606.18264#bib.bib27))、线下事件影响在线仇恨的方式 (Olteanuet al.,2018 (https://arxiv.org/html/2606.18264#bib.bib28)),以及更广泛的关于种族主义如何在主要社交媒体平台上传播的系统性综述 (Matamoros-Fernández and Farkas,2021 (https://arxiv.org/html/2606.18264#bib.bib26))。在审核方面,警示标签和事实核查标签在某些条件下减少了分享行为 (Mena,2020 (https://arxiv.org/html/2606.18264#bib.bib11);Claytonet al.,2020 (https://arxiv.org/html/2606.18264#bib.bib4)),但也可能对未标记内容产生隐含真相效应 (Pennycooket al.,2020 (https://arxiv.org/html/2606.18264#bib.bib15))。据我们所知,这一系列工作尚未被用作多LLM智能体级联模拟器的实证锚点。 ### 基于LLM的智能体与社会模拟。 越来越多的研究使用LLM在社交、经济和调查环境中模拟人类决策 (Parket al.,2023 (https://arxiv.org/html/2606.18264#bib.bib13);Argyleet al.,2023 (https://arxiv.org/html/2606.18264#bib.bib22);Hortonet al.,2023 (https://arxiv.org/html/2606.18264#bib.bib23);Ziemset al.,2024 (https://arxiv.org/html/2606.18264#bib.bib24)),并讨论了社会模拟方法论 (Törnberget al.,2023 (https://arxiv.org/html/2606.18264#bib.bib17);Bail,2024 (https://arxiv.org/html/2606.18264#bib.bib2);Gaoet al.,2024 (https://arxiv.org/html/2606.18264#bib.bib6))。这些研究表明,LLM智能体原则上可以基于画像、内容和上下文进行条件化。 ## 3 数据与网络构建 ### 平台与时间窗口。 我们从Bluesky收集数据,这是一个开放的、去中心化的社交平台,其API暴露了关注者图和转发(reshare)痕迹。收集窗口为2026年1月1日至4月12日(102天),我们通过Bluesky的sort=top搜索API以每日时间窗口分片的方式,检索了转发次数最多的前2,000条英文帖子。 ### 主题选择。 主题选择是基于级联池的数据驱动方式,而非关键词定位。所有前2,000条帖子通过一个两遍流程(先GPT-4o-mini,后GPT-4o,一致性判断)进行分类,以识别显式仇恨言论、隐式仇恨言论和社会偏见;对结果候选集进行人工检查,从同一平台上选出三个主要仇恨级联(涵盖三个不同维度)和一个规模匹配的良性对照:(1) 级联A — 反跨性别/基于身份 (2,267 名转发者);(2) 级联B — 伊斯兰恐惧症/族裔-宗教 (2,796 名转发者);(3) 级联C — 反DEI/社会-种族 (2,942 名转发者);以及 (4) 良性对照 — 非政治娱乐评论 (3,980 名转发者)。转发者数量反映的是完整收集集;表1 (https://arxiv.org/html/2606.18264#S4.T1) 中的级联树大小在基于时间戳的扩散树推断后略有减小。遵循仇恨言论研究的伦理惯例,原始的Bluesky级联种子句柄在本文中使用上述单字母别名进行匿名化处理(附录C (https://arxiv.org/html/2606.18264#A3) 中引入的次级级联D-F也如此);句柄到别名的映射可应要求提供给审稿人。 ### 研究设计。 本研究采用案例研究设计:对三个仇恨级联中的每一个都使用完整指标体系进行特征描述,并与良性对照进行对比。由于仇恨级联数量 N=3,我们报告每个级联的方向和幅度,而非分布性泛化,并标记哪些发现跨主题重复。使用了两个网络层:关注者网络(主题范围内用户之间的关注关系有向图)和转发网络(构成观测级联树的转发链有向图)。 ### 网络构建与属性推断。 对于每个级联,我们收集转发者集合、他们的画像,以及每个转发者的关注列表(仅保留其他转发者和级联根节点)。扩散树是根据内部关注者图和通过 com.atproto.repo.listRecords 端点获取的每个用户转发时间戳推断的:每个转发者的推断父节点是其关注的最早的先前转发者,否则为根节点。未进行下采样;每个级联的完整转发者集合(2,241–3,919个节点)在此规模下是可处理的。每个用户在四个属性维度上进行标注,由 GPT-4o-mini (T=0) 从用户简介文本、最多30条近期帖子以及级联的主题上下文中推断:(i) 社区身份(用户所属的话语社区);(ii) 对主题的立场(支持、反对、中立或不清楚,使用跨级联别名化的主题特定标签);(iii) 账户类型(个人、组织、活动家、机器人或不清楚);以及 (iv) 毒性参与(在窗口期内之前参与仇恨内容的程度)。置信度低于0.65的标签被替换为“不清楚”;推断出的属性被视为有噪声的估计,并通过在阈值 {0.50, 0.65, 0.80} 上检查下游同质性差异的符号稳定性进行审计。 ### 同质性测量。 对于属性 a,其组别为 g1, g2, ...,同质性定义为一条边连接同组节点的概率,H_a = P(边连接同组节点 | a)。我们在关注者网络(结构同质性)和扩散树(行为同质性)上测量 H_a,并报告同质性差异 ΔH_a = H_a^{扩散} - H_a^{关注者}。我们测量关注者网络(结构同质性)和扩散树(行为同质性)上的 H_a,并报告同质性差异 ΔH_a = H_a^{扩散} - H_a^{关注者}。
相似文章
情感如何在LLM智能体间传播:人群模拟中的涌现情感传染
本文提出了一种多智能体人群模拟,使用LLM驱动的智能体通过视觉、听觉和触觉通道相互感知和评估,导致涌现的情感传染,无需显式手工编写的情感转移。研究展示了在五个场景中空间、时间和人格依赖的传染动态,并评估了后端依赖的评估行为。
内存增强型LLM智能体中的状态污染
本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。
漂白仇恨、抹黑无害内容:针对基于LLM的内容审核的注释者风格反驳攻击
本文研究了基于LLM的仇恨言论审核对注释者风格反驳的敏感性,表明此类攻击会降低性能,并揭示了漂白和抹黑操作之间的方向性不对称。
LLM智能体可预测社交媒体反应但仍不敌文本分类器:基于1511人12万+人格的仿真准确性基准测试
大规模研究发现,LLM智能体以70.7%的准确率预测个人社交媒体反应,却仍落后于简单TF-IDF分类器,凸显其操控风险与政策模拟价值。
信念级联驱动LLM代理网络中的说服
本文提出一个受控测试平台,用于分析LLM代理网络中目标导向的说服,发现说服动态取决于网络拓扑、竞争、主题和模型先验。