分析有毒行为及其对Mastodon社区的影响

arXiv cs.CL 论文

摘要

本文利用自然语言处理和机器学习方法,分析去中心化Mastodon平台上的有毒行为,探讨独立运营服务器上内容审核的挑战,并为构建更健康的在线社区提供见解。

arXiv:2607.21980v1 Announce Type: new 摘要:Mastodon作为一个由独立审核的社交服务器组成的去中心化联邦,在检测和缓解有毒内容方面面临独特挑战。由于缺乏统一的审核标准,整个生态系统多样且不均衡。本文利用机器学习方法分析用户帖子,探索Mastodon上有毒行为的产生与传播。研究结果清晰地揭示了毒性趋势及其对社区健康和去中心化治理的影响。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:39

# 分析有毒行为及其对Mastodon社区的影响
来源:https://arxiv.org/html/2607.21980
Pasan Kamburugamuwa, Scrivner, Olga B Luddy School of Informatics, Computing, and Engineering Indiana University Bloomington pkamburu@iu\.edu, obscrivn@iu\.edu

###### 摘要

Mastodon作为一个由独立审核的社交服务器组成的去中心化联合网络,为检测和缓解有毒内容带来了独特挑战。该平台缺乏统一的审核标准,生态系统多样且不均衡。本文利用机器学习方法分析用户帖子,探讨Mastodon中有毒行为的演变与扩散。研究结果揭示了毒性趋势及其对社区健康与去中心化治理的影响。

## I 引言

Mastodon是一个去中心化的社交媒体平台,用户可以自由表达观点、讨论和探索不同话题与趋势。但与其他社交平台一样,它也存在滋生不文明行为的空间。Mastodon的交流是介导性的,这意味着许多抑制负面行为的社会线索(如语气、面部表情等)缺失。其去中心化特性加上用户感知的匿名性,也可能助长有毒行为。无论是仇恨言论、侮辱性用语还是其他不尊重内容,Mastodon互联服务器网络中的毒性正在上升。

Mastodon以去中心化方式运行,即每个服务器(也称为实例)都有自己的审核政策和社区准则,这使得检测和打击有毒内容变得困难。与可以统一执行一致政策的中央集权系统不同,Mastodon将规则制定权交给每个实例的管理员。这可能导致执行标准不一致,并在控制有害内容跨联邦扩散方面带来挑战。此外,该平台的设计鼓励用户在不同实例间迁移,或创建自己的私有实例,这可能加剧回音室效应,使有毒行为无限制地传播。

理解和应对Mastodon中毒性动态不仅对保护用户福祉至关重要,也关乎维护该平台所倡导的开放包容交流精神。在本文中,我们通过自然语言处理技术,利用Google Perplexity API等先进工具分析用户创建的内容,来衡量Mastodon中的有毒互动水平。本研究通过考察毒性的模式与扩散,旨在为如何在去中心化环境中构建更健康的在线社区提供有益信息。

## II 文献综述

像Mastodon这样的去中心化社交媒体平台以其强调用户自主、数据隐私和社区主导治理而挑战了中心化平台。但这种去中心化模式也带来了自身挑战,尤其是在内容审核和毒性检测方面。与具有统一审核政策和集中执法的中心化系统不同,Mastodon是由独立运营的服务器(实例)组成的联邦,每个实例都有自己的社区标准和审核实践[1 (https://arxiv.org/html/2607.21980#bib.bib1)]。这种碎片化削弱了对抗毒性的努力,因为不同实例对有害内容的定义和执行各不相同。

与拥有统一审核政策和集中执法的中心化系统相反,Mastodon采用独立管理的服务器联邦,每个服务器都有自己的社区标准和审核实践[2 (https://arxiv.org/html/2607.21980#bib.bib2)]。这种碎片化性质使得对抗毒性变得困难,因为什么构成有毒内容以及如何执行在不同实例间差异很大。先前研究观察到,不一致的审核实践可能使有害行为者游走于政策薄弱的服务器之间,从而削弱整个平台的审核成效[3 (https://arxiv.org/html/2607.21980#bib.bib3)]。

此外,许多去中心化系统存在技术及组织上的局限性,难以部署中心化平台上常见的自动化审核工具。用于检测有毒行为或仇恨言论的复杂机器学习算法需要大量数据集和可观的计算资源,而这对于小型、独立运行的Mastodon实例来说往往无法获得[4 (https://arxiv.org/html/2607.21980#bib.bib4)]。此外,联邦平台缺乏中央数据聚合机制,给构建用于毒性检测的稳健数据集带来挑战,从而限制了现有工具的有效性[5 (https://arxiv.org/html/2607.21980#bib.bib5)]。

另一个重要问题是去中心化环境中算法审核的伦理问题。近期研究批评了内容审核算法在公平性和包容性方面的不足,尤其是在具有文化背景和语言差异的多元社区中[6 (https://arxiv.org/html/2607.21980#bib.bib6)]。像Mastodon这类平台的去中心化性质使这一问题更加复杂,因为审核工具需要适应每个个体服务器的社区规范,而这些规范可能与全球识别有害内容的标准并不一致。

Mastodon用户驱动的治理模式也导致规则执行不一致,因为审核员通常缺乏正式培训或统一的规则。关于去中心化审核的研究表明,依赖志愿者审核员可能导致倦怠和执行实践的不一致[7 (https://arxiv.org/html/2607.21980#bib.bib7)]。此外,Mastodon的联邦结构容易产生有害溢出效应,即一个服务器上被禁止的问题内容可能蔓延到其他服务器,导致有害材料呈现碎片化但持续存在的状态[8 (https://arxiv.org/html/2607.21980#bib.bib8)]。

像Mastodon这类平台的主要优势之一在于其去中心化特性,这赋予用户对自身体验和隐私更多的控制权。然而,代价是确保安全健康的在线空间变得更加困难。应对这些挑战需要技术创新(如联邦机器学习方法[9 (https://arxiv.org/html/2607.21980#bib.bib9)])与实例间协作相结合,以制定审核方面的共享规范和最佳实践。

## III 研究问题

Mastodon的去中心化架构虽然促进了自主性和多样性,但也给处理社区中的毒性问题带来困难。本研究旨在分析以下问题:

Mastodon联邦的去中心化结构如何影响有毒内容的传播与管控?这对用户体验和社区意味着什么?

该问题旨在理解Mastodon互联服务器中有毒行为的扩散情况,考察现有审核程序的有效性,并评估它们对Mastodon社区整体健康的影响。

## IV 数据集与方法

### IV-A 数据集

我通过分析2025年5月1日至3日三天内的帖子,研究了Mastodon联邦中有毒内容的扩散。选择这一时间段是为了匹配全球政治发展引发的用户参与度增加时期。我将分析重点放在以英语为主的实例中排名前10的最活跃用户。总共收集了25,777名用户的数据,包含1,035,949条帖子。

### IV-B 毒性分数

与仅从帖子内容得出简单毒性分数不同,我们使用了Google的Perspective API[10 (https://arxiv.org/html/2607.21980#bib.bib10)]来计算每条帖子的“毒性”分数。这些分数介于0到1之间,分数越高表示文本中毒性水平越高。分析针对来自25,777名用户的约100万条帖子进行,利用Perspective API衡量内容的毒性。

我们还使用Perplexity API对帖子进行了毒性测试。该API采用最先进的自然语言处理技术生成毒性分数,能够精确测量文本的毒性水平。为确保毒性评估的一致性和可靠性,分析中仅包含英语帖子。

### IV-C 数据收集

帖子从以下Mastodon实例收集,这些实例因其在联邦中的显著性和活跃度而被选中。实例列于表I (https://arxiv.org/html/2607.21980#S4.T1)。

表 I:用于分析的选定Mastodon实例
### IV-D 数据处理

我们检索了每个实例在研究期间排名前10最活跃用户的帖子。帖子经过筛选,仅保留英语内容。然后使用Perplexity API确定每条帖子的毒性程度。对于每个文本输入,API返回一个毒性分数,表示内容含有有毒、冒犯或不尊重语言的程度。

### IV-E 分析

对毒性分数进行汇总和分析,以发现选定Mastodon实例中有毒内容扩散的趋势。比较分析旨在探讨不同实例间毒性水平的差异,以及Mastodon的去中心化结构如何影响这些模式。

Mastodon实例及其用户数量和帖子总数见表II (https://arxiv.org/html/2607.21980#S4.T2)。

表 II:带有用户和帖子信息的选定Mastodon实例分析
图1:每个实例的平均毒性分数

## V 结果

对选定Mastodon实例的毒性分数分析显示,所分析实例的整体毒性水平相对较低。Perplexity API为研究期间排名前10最活跃用户的帖子提供了毒性分数,但仅有英语帖子被评分。

选定用于分析的Mastodon实例及其用户数量和帖子总数见表II (https://arxiv.org/html/2607.21980#S4.T2)。不同实例的用户数量存在差异,其中mastodon.social用户最多(5,871人),而aethy.com用户最少(163人)。分析表明,尽管用户基数规模不同,帖子总数在不同实例间也相应变化,从aethy.com的1,282条到mastodon.social的42,960条。

分析从毒性水平角度进行,即各实例帖子的平均毒性分数。图1 (https://arxiv.org/html/2607.21980#S4.F1)显示了所有实例的平均毒性分数,均远低于0.2的阈值,表明这些实例上的内容总体上毒性不高。平均毒性分数最高的是aethy.com(0.214),虽然高于其他实例,但仍处于相对较低的毒性范围内。这表明aethy.com可能含有稍多的有毒内容,但仍符合实例中观察到的低毒性趋势。

在比较毒性分数时,我们发现大多数Mastodon实例之间没有显著差异。例如,chaos.social、mstdn.social和hachyderm.io显示出非常低的平均毒性分数,始终低于0.1,这暗示了有效的内容审核或一种社区文化能够抑制有害语言的使用。相比之下,mastodon.social和mas.to的平均毒性分数略高,但仍低于0.2的阈值。

这些发现表明,Mastodon的去中心化并不必然与较高的毒性水平相关。相反,像mastodon.social这样用户规模较大的实例,其毒性相对较低;而像aethy.com这样的小型站点则相对含有较高比例的有害内容。这说明了社区审核实践的重要性及其对实例整体毒性的影响。

需要进一步研究来理解这些差异的原因,尤其是aethy.com的社区动态和审核政策,该实例的毒性水平略高。了解这些模式可以为改进Mastodon实例的审核策略提供有用信息。

## VI 讨论与结论

对不同Mastodon实例毒性水平的研究为去中心化社交媒体环境中有害内容的特征提供了有益见解。结果表明所研究案例的毒性水平总体较低,但存在一些值得进一步关注的小差异。

分析中一个有趣的观察是,所有实例的平均毒性分数都相对较低,且没有一个超过0.2的阈值。这一观察表明,Mastodon用户平均而言更倾向于进行相对文明的讨论,这可能是由于平台的去中心化特性以及各实例不同的审核实践。许多Mastodon实例以社区为中心的审核或许有助于对抗有害内容。每个实例可以自行制定规则,并根据社区标准执行。

然而,分析发现了一个明显的异常值——aethy.com,其在样本实例中平均毒性分数最高(0.175)。这一分数虽处于低毒性范围,但也引发疑问:规模较小、审核较弱的实例是否更容易出现较高水平的有害内容?这可能是因为审核政策较差、缺乏积极的社区自我调节,或者用户基数较小,缺乏大型实例那样的社会问责。需要进一步研究来阐明aethy.com的高毒性分数及其审核实践。

此外,像mastodon.social这样用户基数较大的实例,其毒性分数相对较低,这表明大型社区可能需要更强大的审核系统,或者大量内容稀释了有害帖子的浓度。相比之下,像mas.to和techhub.social这样较小的实例也表现出低毒性,说明毒性并不必然与用户基数大小相关,而是与实例的具体动态和审核实践有关。

尽管存在这些差异,所观察案例中报告的整体低毒性分数与Mastodon作为一个鼓励相对积极和尊重用户互动的平台声誉相符。但毒性分数上的微小差异表明,确保所有实例都拥有良好审核系统的重要性,无论其规模大小。较高水平的有害内容可能促使平台考虑调整审核政策或采取额外措施来减轻毒性,为用户营造更安全的环境。

对各个Mastodon实例毒性水平的总体结论是,该平台总体上有害内容较低。因此,社区审核有望监管像Mastodon这样的去中心化社交媒体平台上的文明讨论。例如,像mastodon.social和hachyderm.io这样的审核系统即使对于大型活跃社区也有助于减少有毒行为。但aethy.com的毒性分数略高,反映出小型实例在处理有害内容时可能面临的挑战。这些发现令人鼓舞。

相似文章

社交媒体毒性——“嘈杂的房间”

Hacker News Top

一项斯坦福大学研究分析了数十亿条社交媒体帖子后发现,仅约3%的用户会发布严重有害内容,但互动驱动型算法不成比例地放大了这部分少数声音,从而扭曲公众认知,并导致大多数用户被迫自我审查。

Twitch聊天中的毒性:基于LLM的跨游戏社区分析

arXiv cs.CL

本文使用预训练LLM进行零样本分类,分析了约2000万条Twitch聊天信息,涵盖七种游戏类型,发现2.4%的消息具有毒性,其中MOBA游戏的毒性率最高(3.2%),体育游戏最低(2%)。研究还发现,同一类型内不同游戏之间的毒性分布存在显著差异。