社会模式在合成数据中是否成立?分析LLM生成与真实对话中的网络欺凌动态

arXiv cs.CL 论文

摘要

本文评估LLM生成的网络欺凌对话是否忠实地再现了真实互动的社会动态,发现虽然高级结构得以保留,但更细粒度的细节以模型依赖的方式系统性地扭曲。

arXiv:2609.17549v1 公告类型:新 摘要: 网络欺凌(CB)是一种复杂的社会现象,其特点是重复攻击、权力失衡和多方互动。尽管大语言模型(LLMs)越来越多地被用于生成合成CB对话以进行数据增强和基准测试,但尚不清楚此类数据是否超越支持下游任务性能,忠实地再现了真实互动的社会动态。我们提出了一个综合框架来评估LLM生成的CB对话的社会现实性。我们比较了由GPT、Grok和LLaMA生成的真实和合成对话,涵盖交互结构(轮换、权力动态和修复行为)、语言和风格现实性(代词使用和幽默)、情感和行为标记(CB类型、脏话和毒性)以及时间升级动态。我们进一步通过人工评估来补充自动分析,评估网络欺凌的存在、场景相关性、角色合理性和社会现实性。我们的结果显示,LLM生成的数据始终保留高级交互结构,包括角色参与模式、方向性权力不对称和行为标记的广泛分布。然而,所有模型都系统性地扭曲了更细粒度的社会现象,包括行为幅度、角色特定分配、分类分布和时间动态。这些扭曲强烈依赖于模型:GPT抑制有害内容,Grok放大攻击性行为,而LLaMA提供最平衡的近似,同时平滑角色区别。我们的发现表明,合成CB数据对于建模全局交互结构是有用的,但当行为现实性和社会动态至关重要时,它仍然是真实对话的不完美替代品。
查看原文
查看缓存全文

缓存时间: 2026/09/17 08:50

# 社会模式在合成数据中是否成立?分析大语言模型生成与真实对话中的网络欺凌动态

来源: https://arxiv.org/html/2609.17549

Arefeh Kazemi¹, Hamza Qadeer¹, Sinan Asci², Joachim Wagner¹, Brian Davis¹

¹ 计算学院,ADAPT中心,都柏林城市大学,都柏林,爱尔兰;² DCU反欺凌中心;¹\{first.last\}@adaptcentre.ie | ²\{first.last\}@dcu.ie

###### 摘要

网络欺凌(CB)是一种故意且重复的在线攻击行为,其特征在于施害者与受害者之间的权力失衡。尽管大语言模型(LLMs)最近被用于生成用于数据增强和基准测试的合成CB对话,但尚不清楚此类数据是否忠实再现了真实互动的底层社会动态——即超越支持下游任务性能之外的效果。本文提出了一个全面的评估框架,用于评估LLM生成的CB对话的社会真实性。我们比较了由GPT、Grok和LLaMA生成的真实对话和合成对话,跨越多个互补维度,包括互动结构(轮替模式、权力动态和修复行为)、语言和风格真实性(代词使用和幽默)、情感和行为标记(网络欺凌类型、脏话和毒性)以及时间升级动态。我们还补充了自动分析,通过人工评估来衡量CB存在、情景相关性、角色可信度和社会真实性。我们的结果表明,LLM生成的数据始终保留了高层级的互动结构,包括角色参与模式、霸凌者与受害者之间的方向性权力不对称以及行为标记的广泛分布。然而,所有模型都系统性地扭曲了更细粒度的社会现象,包括行为幅度、角色特定分配、类别分布和时间互动动态。此外,这些扭曲强烈依赖于具体模型:GPT倾向于抑制有害内容,Grok放大了攻击性行为,而LLaMA提供了最平衡的近似,同时平滑了角色区分。这些发现表明,合成CB数据是全局对话结构的有用近似,但在行为真实性和社会动态至关重要时,仍然是真实互动的不完美替代品。我们的工作为合成对话提供了一个基于社会现实的评估框架,并为在CB及其他基于社会现实的自然语言处理应用中选择和评估LLM生成的数据提供了实用指导。

## 1 引言

大语言模型(LLMs)最近已成为生成跨多种自然语言处理(NLP)任务合成数据的强大工具He等(2021,2022);Bonifacio等(2022);Meng等(2022)。通过利用其生成流畅且上下文连贯文本的能力,LLMs越来越多地用于数据增强、少样本学习和合成数据集生成。在许多情况下,这种合成数据可以显著提高模型性能,并且在特定条件下,特别是经过仔细过滤或与真实数据结合时,可以接近在人类标注数据集上训练的模型的性能Gupta等(2023);Anaby-Tavor等(2020);Li等(2023b)。在标注数据稀缺或获取成本高的领域,合成数据生成提供了一种可扩展且灵活的替代方案,能够快速开发和评估NLP系统。这些发展影响尤为显著的一个领域是网络欺凌(CB)检测。网络欺凌是一种普遍存在的在线攻击形式,对儿童和青少年的影响尤为严重,涉及故意伤害、重复发生和权力失衡Hinduja和Patchin(2014);Patchin和Hinduja(2006)。重要的是,CB本质上是互动性和依赖上下文的;有害意图通常通过涉及霸凌者、受害者和旁观者的多轮交流产生,而非孤立的Sheth等(2022);Ziems等(2020)。因此,理解和建模CB不仅需要捕捉单条消息的内容,还需要捕捉对话的动态,包括升级模式、角色行为和关系线索。

尽管如此重要,收集和标注真实的CB数据带来了巨大挑战。伦理和法律限制限制了对涉及未成年人对话的访问,尤其是当对话包含敏感或有害内容时2020。创建此类数据集受到高昂成本和手动标注耗时性质的限制,同时也存在伦理问题,包括标注人员接触令人痛苦的材料以及再次创伤的风险AlEmadi和Zaghouani(2024)。此外,青少年的交流高度动态,受到不断演变的俚语、多模态表达和依赖上下文的意义的影响,使得静态数据集难以随时间保持代表性Dembe(2024);McGillivray等(2022)。这些挑战造成了持续的数据瓶颈,限制了上下文感知的CB检测和同伴攻击计算建模的进展。

为解决这些局限性,近期研究探索了使用LLMs生成合成CB数据Kazemi等(2025a, b)。此类数据集可以整合多轮对话结构、角色特定行为和细粒度标注,同时避免真实数据收集中的许多伦理和法律限制。实证研究表明,在合成数据上训练的模型在CB检测方面可以达到接近在真实数据上训练的模型的性能Kazemi等(2025a)。这些结果将合成数据定位为扩展在线安全研究的有前途的解决方案。然而,一个重要问题仍未得到充分解决:虽然合成数据可能支持下游任务性能,但它是否忠实再现了真实互动的底层社会动态?CB不仅仅是一种词汇现象,而是一个涉及主导、抵抗、升级和群体行为模式的复杂社会过程Chandrasekharan等(2017);Cheng等(2017);Wulczyn等(2017);Zhang等(2018)。如果合成对话未能捕捉到这些深层结构,那么在其上训练的模型可能学习到表面信号,而忽略了体现现实世界霸凌的机制。这引发了关于合成数据在需要行为理解的应用(如干预设计、政策制定和在线社区模拟)中有效性的严重关切。

除了评估之外,识别合成数据与真实数据之间的系统性差异也为改进生成模型本身提供了机会。通过揭示LLM生成的对话在何处偏离真实互动——无论是在角色行为、升级动态还是语言表达方面——我们可以更好地理解当前生成范式的局限性,并设计更有效的提示、对齐或训练策略。从这个意义上说,分析社会真实性不仅是诊断性的,也是规范性的,为生成更忠实反映人类社会行为的合成数据提供了途径。

在本研究中,我们通过系统评估LLM生成的CB对话是否保留了真实对话中观察到的社会模式来解决这一差距。我们不仅关注基于任务的表现,而是提出了一个基于计算社会科学和会话分析的多维分析框架。我们的框架考察三个互补的维度:(i)互动结构,包括轮替模式、权力动态和道歉、辩护;(ii)语言和风格真实性,包括代词使用、模糊限制语和强调手段;以及(iii)情感和行为标记,包括CB类型、毒性、脏话、情绪和升级轨迹。通过在这些维度上比较真实和合成数据集,我们评估了LLMs在多大程度上再现了CB互动的语言和社会组织。

除了自动分析,我们还进行了人工评估,以衡量感知真实性,维度包括角色可信度、社会连贯性和情景一致性。这使我们能够考察真实性主观判断与客观结构属性之间的关系,从而更全面地理解合成数据的优势和局限性。

本文做出以下贡献:(1)我们提出了一个基于社会现实的评估框架,用于分析网络欺凌对话,捕捉超越表层文本特征的互动、语言和情感维度。(2)我们对真实和LLM生成的网络欺凌对话进行了比较分析,并对多种LLMs进行了跨模型比较,评估不同模型在再现这些社会维度方面的表现。(3)我们表明,虽然合成数据可以近似表层语言模式,但它未能完全捕捉真实对话中存在的更深层的社会和互动动态。(4)我们纳入了人工评估会话真实性以补充自动指标。

本文的其余部分组织如下。第2节回顾了关于网络欺凌检测、合成数据生成和语言模型评估的相关工作。第3节描述了本研究中使用的数据集。第4节介绍了我们的分析框架和指标设计。第5节概述了实验设置。第6节报告了定量分析的结果,随后是第7节的人工评估。第8节讨论了我们发现的意义,第9节总结了论文。

## 2 相关工作

### 2.1 网络欺凌检测与分析

网络欺凌作为一种故意伤害、重复发生和权力失衡为特征的在线攻击形式,已被广泛研究Patchin和Hinduja(2006);Ejaz等(2024)。早期的网络欺凌检测工作主要关注消息级分类,将实例视为独立处理,并依赖词汇和句法线索López-Vizcaíno等(2021);Dadvar等(2012)。虽然这种方法在毒性检测方面取得了良好性能,但它们常常无法捕捉到网络欺凌的依赖上下文和互动的特性。最近的研究强调,网络欺凌通过多轮对话展开,意义通过话语动态、角色互动和升级模式产生2023;2018。细粒度的、角色感知的数据集Van Hee等(2018);Sprugnoli等(2018);Ollagnier等(2022)推动了网络欺凌研究,但在规模、类别平衡、生态效度和青少年代表性方面仍有限制。此外,网络欺凌语言演变迅速,包含俚语、表情符号和隐含表达Dembe(2024);McGillivray等(2022)。因此,在静态数据上训练的模型难以泛化到新兴或模糊的霸凌模式,如讽刺、排斥性幽默或微妙的同伴操纵。这些局限性促使人们需要新的数据源和评估框架,这些框架超越表层分类,更好地反映网络欺凌的社会动态。

### 2.2 合成数据与LLM生成的文本

大语言模型(LLMs)的最新进展使得可扩展且高质量的合成数据生成成为可能,提供了比手动标注数据集更可控且通常更符合伦理安全的选择。鉴于其在自然语言理解和生成方面的强大能力,LLMs已被广泛探索用于各种NLP任务的合成数据创建。早期工作利用LLMs进行数据增强、知识蒸馏和少样本学习Anaby-Tavor等(2020);He等(2021, 2022);Bonifacio等(2022);Meng等(2022);Yoo等(2021),其中合成样本用于训练或微调下游模型,包括序列分类器和检索系统。例如,He等(2021, 2022)探索了LLM生成的数据用于知识蒸馏、自训练和少样本学习,标注由最先进的分类器产生。类似地,Bonifacio等(2022)使用LLMs在少样本设置中生成用于信息检索的标注数据,然后用于微调较小的检索模型进行重排序。此外,Yoo等(2021)提出通过在提示中嵌入任务特定句子来增强训练数据,而Anaby-Tavor等(2020)在有限标注数据上微调语言模型,随后使用它生成额外的标注样本。Meng等(2022)还探索了使用标签描述性提示进行基于类别的生成,用于分类任务。

除了通用NLP应用,合成数据生成也在特定领域环境中进行了探索。在医学领域,Wang等(2024)引入了NoteChat,这是一个从临床文档生成合成患者-医生对话的多智能体框架。在心理健康背景下,Ghanadian等(2024)......

相似文章

当合成用户失效时:LLM模拟人类调查响应的跨领域基准测试

arXiv cs.CL

本文在两个大规模数据集上对LLM模拟的人类调查响应进行了基准测试,发现没有模型在个体层面上能超越简单的基线,并且模型系统性地过度决定人口统计特征,扭曲了群体差异。这些失败在不同模型规模和系列中持续存在,引发了对使用合成用户进行决策支持的担忧。

采用 $\neq$ 适应:野外LLM对话的纵向分析

arXiv cs.AI

本文分析了必应Copilot用户的纵向对话轨迹,并与WildChat数据进行比较,发现个体用户习惯具有粘性,且WildChat过度代表了高级用户,挑战了用户与LLM互动的静态观点。