BERTopic-Virality Prioritisation: 用于Twitter上COVID-19和Monkeypox错误信息主题与比较分析的可扩展框架

arXiv cs.CL 论文

摘要

BERTopic-VP 是一种病毒性优先的主题建模框架,结合聚类与错误信息检测模块,用于分析 Twitter 上的健康错误信息,在 COVID-19 和 Monkeypox 疫情中实现了高分类性能。

arXiv:2608.15691v1 Announce Type: new 摘要: 大流行期间传播的健康错误信息可能迅速获得关注,形成与公共卫生指导相竞争的有害叙事。大多数主题建模流程将参与度视为外部结果,限制了其优先选择语义连贯且快速扩散的主题的能力。我们引入 BERTopic-VP,一个病毒性优先的主题建模框架,结合了基于上下文嵌入的聚类(BERTopic)和事后病毒性优先(VP)层。该流程辅以一个两阶段混合错误信息检测模块,融合了监督式基于内容的分类器和来自公共卫生知识库的外部验证信号。应用于三个基准数据集 COVID-19_FNIR、Monkeypox 和 Constraint,该框架实现了强大的分类性能,F1 值高达 0.950,ROC-AUC 高达 0.989,同时在 top 1%、5% 和 10% 的 VP 阈值下识别出高影响力聚类。对于没有原生参与度元数据的数据集,优先级基于逻辑传播倾向分数,作为扩散潜力的序数代理,而非参与度的直接度量。结果表明,整合语义结构、病毒性感知排名和情感语言分析能够实现跨大流行错误信息的可扩展且可解释的比较分析。所提出的框架通过揭示低数量但高风险的叙事供分析师审查,支持面向监控的早期预警。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:13

# BERTopic-病毒性优先级排序:一个用于主题与对比分析的Twitter上COVID-19与猴痘错误信息的可扩展框架
来源:https://arxiv.org/html/2608.15691
###### 摘要
大流行期间流传的健康错误信息可能迅速获得关注,形成与公共卫生指导意见相竞争的有害叙事。大多数主题建模流程将参与度视为外部结果,限制了其优先考虑语义连贯且同时快速传播的主题的能力。我们引入BERTopic-VP,这是一个将基于上下文嵌入的聚类(BERTopic)与事后病毒性优先级排序层相结合的病毒性优先主题建模框架。该流程辅以一个两阶段混合错误信息检测模块,该模块融合了一个基于监督内容的分类器和一个源自公共卫生知识库的外部验证信号。该框架应用于三个基准数据集(COVID-19_FNIR、Monkeypox和Constraint),实现了强大的分类性能(F1高达0.950,ROC-AUC为0.989),同时在Top 1%、5%和10%的病毒性优先级阈值下识别出高影响力集群。对于没有原生参与元数据的数据集,优先级排序基于逻辑传播倾向分数,该分数用作扩散潜力的序数代理,而非参与度的直接衡量。结果表明,整合语义结构、病毒性感知排序和情感语言学分析,能够实现对跨大流行错误信息的可扩展且可解释的对比分析。所提出的框架支持以监控为导向的早期预警,通过呈现低量但高风险的叙事供分析师审查。
###### 索引词:BERTopic,COVID-19,健康错误信息,信息疫情,错误信息检测,猴痘,公共卫生传播,主题建模
††地址:曼彻斯特大都会大学计算与数学系,英国曼彻斯特(电子邮箱:[email protected])
††标题注:本工作未获得任何财务支持。
††通讯作者:MKULULI SIKOSANA(电子邮箱:[email protected])。

## I 引言
尽管主题建模在健康错误信息研究中很常见,但传统方法如潜在狄利克雷分配难以适应社交媒体话语中快速变化的词汇、短文本长度和动态标签趋势。本研究表明,基于嵌入的主题聚类方法可以早期检测错误信息主题,使公共卫生团队能够迅速用基于证据的信息作出回应。传统的技术,如LDA、非负矩阵分解或TF-IDF+k-means,依赖于词频信号,当文本简短、由标签驱动且不断演变时(这在Twitter上很典型),这些信号就会失效。为了克服这些局限性,我们引入了一种新颖的BERTopic应用,展示了其适应现实世界健康通信监测的能力,以及在批处理刷新设置下支持具有监控导向的主题跟踪和优先级排序的数字公共卫生系统的能力。通过将上下文嵌入与基于密度的聚类相结合,我们的方法快速对新主题进行分组,帮助官员在疫情爆发期间识别和比较错误信息。这种新颖的BERTopic应用通过识别可能塑造公众对疾病风险、信任和行为理解的数字媒体叙事,支持主动的健康传播策略。其优势在于语义敏感性,能够在新兴叙事形成高频模式之前就进行检测,使其特别适合在近实时批处理刷新设置下进行跨信息疫情的对比分析。我们引入了一种先进的基于BERTopic的方法,并将其进行比较应用,以说明信息疫情动态在不同公共卫生危机中可能如何及为何存在差异。这项工作通过展示如何利用嵌入和主题聚类来揭示跨时间窗口的叙事转变,推进了健康信息学的发展,该能力可以在定期(分钟到小时)刷新节奏下支持及时的风险沟通。我们引入了BERTopic-VP,这是BERTopic框架的一个扩展,它集成了病毒性优先级排序,以支持对新兴健康错误信息主题的监控和分诊。BERTopic使用语义嵌入和基于密度的聚类执行无监督主题建模,而BERTopic-VP则在可用的情况下,用参与信号(如点赞、转推、回复和引用)增强生成的聚类。如果数据集不包含给定的参与字段(例如,链接点击),则仅基于可用分量计算复合参与度分数,缺失的分量被视为*未观察到*,而非行为上等同于零。这种参与度信息覆盖层使聚类能够根据其在数据集内的*相对*病毒潜力进行排序,支持分析师主导的优先级排序和信息疫情情境下的及时态势感知。据我们所知,很少有应用研究将上下文主题建模与明确的病毒性导向优先级排序阶段相结合,用于跨大流行错误信息分析。我们将BERTopic-VP定位为一项实用贡献,它在这个可复现的流程中实现了这种集成。
### I-A 问题陈述与研究缺口
大流行期间的错误信息可能破坏公共卫生干预措施,并在社交媒体用户中制造混乱。在此背景下,第一作者此前合著的研究使用传统的机器学习、深度学习和基于Transformer的方法检查了COVID-19错误信息检测。尽管许多先前的工作研究了长形式内容,如新闻文章或论坛帖子,但最紧急的信号现在出现在*简短、嘈杂的文本*中,例如280个字符以下的Twitter帖子。传统的检测方法,包括基于规则的分类器和LDA,在此类微文本上表现不佳。相反,基于嵌入的模型更适合捕获短消息中的语义模式。为了应对这些挑战,我们引入了BERTopic-VP,这是一个新颖的流程,它通过集成病毒性优先级排序来扩展BERTopic,通过参与度感知的聚类排序实现。该增强功能支持通过定期批处理刷新进行监控,并优先处理快速传播的错误信息主题。BERTopic-VP利用上下文嵌入、基于密度的聚类和事后病毒性信号(例如转推、点赞、链接点击等)来检测错误信息主题,并标记高影响力集群以进行早期干预。许多现有系统专注于揭穿已知的说法,但缺乏对错误信息如何动态出现和传播的洞察。很少有研究提供跨多个大流行的比较分析。例如,在2003年中国的SARS爆发期间,谣言通过短信、地方报纸、省级电视台和广播热线节目传播。相比之下,COVID-19的虚假信息通过全球联网的平台如Twitter、Facebook、YouTube和微博被放大。虽然错误信息伴随着自2000年以来的所有主要疫情,但系统性的跨事件比较仍然很少。因此,关键问题持续存在:谣言主题在埃博拉和COVID-19等大流行中是否重现?新的阴谋论是出现还是被循环使用?现有的检测方法也难以在高流量、高噪音的社交流中捕捉早期信号。理解这些动态对于预警系统和实时政策响应至关重要。BERTopic-VP通过整合语义聚类和病毒性信号,为公共卫生监测仪表板提供优先的、可解释的错误信息监控,从而解决了这一缺口。
### I-B 假设与方法动机
我们假设BERTopic-VP非常适合在Twitter上短期文本稀疏的条件下揭示新兴的健康危机错误信息主题,而基于频率的主题模型在此条件下普遍报告性能下降。与先前的微文本证据一致,我们假设基于嵌入的主题发现比LDA和NMF等经典基线以及简单的TF-IDF+k-means流程产生更精细、更可解释的聚类。本文使用研究内一致性、聚类诊断和可解释性分析来评估该假设,而从文献中提取的任何基线数据仅用于上下文,本文未对其进行重新实现。由于它将上下文BERT嵌入与基于密度的聚类相结合,BERTopic-VP即使在稀疏、快速变化的环境中也能形成语义连贯的推文聚类(称为*微主题*)。相比之下,基于频率的基线需要重复使用标记来稳定主题估计,并且经常合并不连贯的叙事。此外,BERTopic-VP通过事后覆盖参与特征来扩展标准BERTopic,允许基于主题的病毒潜力进行动态排序。这有助于在信息疫情中进行优先的、实时的错误信息检测。由于缺乏比较工作,我们对驱动错误信息在不同背景下传播的因素缺乏清晰的理解。现有的检测方法也难以捕捉早期信号,特别是在简短、高流量的社交媒体流中。理解这些跨大流行的模式至关重要。该流程通过为监测仪表板和知情决策提供错误信息的早期预警来支持公共卫生。
### I-C 研究目标
为了在本文范围内操作化和评估所提出的研究流程,本研究追求以下主要目标:
1. 1.开发一个BERTopic-VP信息疫情检测流程,利用语义嵌入和病毒性信号,从大流行Twitter数据中提取、聚类和优先排序错误信息主题。
2. 2.通过使用研究内指标评估一致性、独特性、稳定性和早期检测性能来对BERTopic-VP进行基准测试,并根据文献中报告的代表性基线结果(未在本文中重新实现这些基线)对观察到的一致性量级进行情境化。
3. 3.通过使用一致的、参与度感知的方法识别、跟踪和比较主导叙事,分析COVID-19和2022年猴痘疫情中的错误信息动态,以获得跨大流行的见解。
##### 基线报告说明。本文未在COVID-19_FNIR、Monkeypox或Constraint数据集上重新实现经典的主题建模基线(例如,LDA、NMF或TF-IDF+k-means)。相反,我们使用研究内证据(包括一致性、聚类质量和可解释性分析)来评估BERTopic-VP。讨论基线值时,它们仅来自先前研究以提供上下文。由于主题模型质量对特定语料库的预处理、超参数调优和一致性实现选择高度敏感,这些文献值未被视为直接对比基准,也不用于声称严格优势。
##### 基线筛选说明(比较范围)。经典词袋主题模型(例如LDA和NMF)广泛报道对简短、由标签驱动的微文本敏感,当标记重叠稀疏时,通常产生混合不同叙事的宽泛主题。在我们语料库(使用相同的预处理输入)的初步筛选运行中,我们定性地观察到这种趋势,几个基线主题将多个COVID-19阴谋流合并为一个混合主题。因为公平的、经过调优的基线重新实现需要大量的特定语料库优化(选择K、先验、标记化、一致性设置),这不是本文的重点,所以我们优先考虑单一的基于嵌入的流程BERTopic-VP,并使用研究内一致性、聚类诊断和可解释性证据对其进行评估。通过这些目标,本研究评估了BERTopic-VP的有效性,并加深了对信息疫情传播的理解。该研究为健康错误信息研究和公共卫生信息学贡献了方法创新。
### I-D 贡献与新颖性
本研究(i)通过引入BERTopic-VP推进了主题建模,该框架将语义聚类与病毒性感知优先级排序相结合,(ii)使用一致的信息学流程对COVID-19和猴痘疫情中的错误信息进行了比较分析,(iii)提出了一个模块化、以监控为导向的流程,可支持定期批处理刷新以供分析师及时审查。完整的可扩展性和实时流处理性能未在本研究中进行评估。
- •我们提出并实现了BERTopic-VP,这是BERTopic的一个扩展,它通过事后参与信号集成病毒性优先级排序,在可用时使用观察到的交互计数(Monkeypox数据集),并为没有原生参与字段的数据集(COVID-19_FNIR和Constraint数据集)使用学习到的代理倾向分数。为了情境化主题质量,我们总结了先前短文本研究中报告的经典基线的代表性一致性值(表XII)。这些基线数据仅包含用于上下文,未在本文的COVID-19_FNIR、Monkeypox或Constraint数据集上重新实现。因此,我们的实证评估基于研究内主题一致性和表III中报告的BERTopic-VP聚类输出。
- •我们首次使用BERTopic-VP作为一致的分析框架,系统性地并列比较了两次不同疫情——COVID-19(2020年)和猴痘(2022年)的错误信息主题。这解决了一个关键的研究缺口,因为大多数先前的信息疫情研究都是孤立地研究单次危机。我们的研究结果揭示,COVID-19错误信息通常围绕阴谋论(例如5G、实验室起源),而猴痘叙事则集中在公众信任、应对失败和污名化,这突显了社会政治背景如何塑造错误信息。

相似文章

超越二元检测:Reddit上癌症错误信息的多维度分类

arXiv cs.CL

本文提出了一种多维度分类法,用于描述Reddit上的癌症错误信息,评估了大型语言模型(LLMs)在注释方面的表现,发现约6%的癌症讨论包含错误信息。它识别出反复出现的叙事,如未经支持的治疗方法和对传统医学的不信任。

多模态图社交媒体流行度预测基准测试

arXiv cs.AI

本文介绍了MMG-Pop,一个用于多模态图社交媒体流行度预测的统一基准,并提出了MMG-PopNet,该模型联合建模多模态内容和时间社交互动。在Bluesky和Reddit数据集上的实验展示了优越的性能,并提供了跨平台泛化和多任务预测的见解。