一种多分支特征融合方法,用于健康虚假信息检测与传播
摘要
本文介绍了一种多分支特征融合框架,用于检测和传播健康虚假信息,整合了语义、修辞和心理学线索,在基准数据集上表现出色。
arXiv:2609.00403v1 公告类型:新
摘要:本文提出一个多分支融合框架,用于检测和表征在线社交网络(OSNs)中健康虚假信息的传播。基于精细化可能性模型(ELM)和计划行为理论(TPB),该模型在统一的多任务架构中,将基于transformer的语义与修辞线索、立场表示以及心理学驱动的代理变量融合在一起。除了二元分类,我们还引入了认知传播分数(CPS),这是一种可解释的事后辅助分数,通过心理学驱动的文本线索计算得出,捕捉论证复杂性、情感强度和内容驱动的病毒传播潜力,以支持在参与度真实数据不完整或不可用时的扩散风险推理。在三个基准数据集(Constraint、COVID--19\_FNIR和Monkeypox)上的实验显示出强大的分类性能,在COVID--19\_FNIR上ROC--AUC高达0.9999,而面向传播的排名在可用参与度监督时达到近乎完美的一致性(Monkeypox,Spearman's $\rho = 0.9952$),在基于代理变量的监督下在COVID--19\_FNIR上也表现出同样高的排名一致性($\rho = 0.9954$)。与代表性文献基线相比,融合模型在Constraint和COVID--19\_FNIR上提高了检测性能,而Monkeypox仍然更具挑战性,反映了领域和信号特定的差异。消融分析进一步表明,心理学和修辞分支在语义嵌入之外提供了互补的增益。总的来说,该框架弥合了认知理论和神经建模,以提高透明度并支持可扩展的虚假信息监测,未来工作需要验证CPS与以人类为中心的扩散判断的一致性。
查看缓存全文
缓存时间: 2026/09/02 06:13
# 面向健康错误信息检测与传播的多分支特征融合方法 来源:https://arxiv.org/html/2609.00403 ###### 摘要 本文提出了一种多分支融合框架,用于检测和刻画在线社交网络中健康错误信息的传播。该模型基于精细加工可能性模型与计划行为理论,将基于Transformer的语义特征与修辞线索、立场表征以及心理学驱动的代理特征融合在一个统一的多任务架构中。除二元分类外,本文还引入了**认知传播分数**——一个可解释的事后辅助分数,它基于心理学驱动的文本特征计算得出,捕捉论证复杂性、情感强度和内容传播潜力,以在互动真实标签不完整或缺失时支持传播风险推理。在三个基准数据集(Constraint、COVID–19\_FNIR和Monkeypox)上的实验显示出强大的分类性能,在COVID–19\_FNIR上ROC–AUC高达0.9999;在有互动监督可用时(Monkeypox),传播导向的排序取得了近乎完美的匹配(Spearman’s ρ=0.9952),在COVID–19\_FNIR上使用代理监督时也达到了同样高的排序一致性(ρ=0.9954)。与代表性文献基线相比,该融合模型在Constraint和COVID–19\_FNIR上提升了检测性能,而Monkeypox数据集则更具挑战性,这反映了领域和信号特异性差异。消融分析进一步表明,心理和修辞分支在语义嵌入之外提供了互补性增益。总体而言,该框架连接了认知理论与神经建模,以提高透明度并支持可扩展的错误信息监控,未来需要通过以人为中心的扩散判断来验证认知传播分数。 ###### 索引词:健康错误信息、特征融合、多分支学习、传播、扩散风险、认知传播分数、精细加工可能性模型、计划行为理论、立场、修辞、社交媒体。 ††地址:英国曼彻斯特曼彻斯特城市大学计算与数学系 (e-mail: [email protected]) ††标题注:本工作未获得任何资助。 ††通讯作者:MKULULI SIKOSANA (e-mail: [email protected]) ## I 引言 在线社交网络上的健康错误信息威胁着公众健康、机构信任和政策制定[1, 2]。在COVID-19疫情期间,误导性言论以惊人的速度传播,导致了不安全行为并侵蚀了对健康指导的信心[3, 4, 5, 6]。尽管人工事实核查至关重要,但它无法适应现代信息流行病的规模和速度[7]。基于Transformer的NLP模型,包括BERT[8]和RoBERTa[9],通过捕捉上下文语言模式改进了真实性分类[10]。然而,许多高性能检测器对于*为什么*内容具有说服力和传播力的行为洞察有限。说服理论提供了一个有用的解释性视角。精细加工可能性模型区分了中心路径处理(论证质量和认知)和边缘路径处理(启发式和情感)[11]。计划行为理论通过态度、主观规范和感知行为控制来解释行为意向[12]。这些构念激发了比仅依赖词元级注意力更具透明度的特征设计。传播建模的一个实际障碍是互动痕迹在不同数据集中并非统一可用。一些语料库包含互动元数据,而另一些则只提供真实性标签。这促使人们开发可以一致地从文本中计算的扩散导向信号,即使在缺失原生互动监督的情况下,也能实现排序和优先级排序。 本文提出了一个基于认知的、多分支、多任务框架,用于错误信息检测和扩散导向分析。该模型将Transformer嵌入与立场、修辞结构以及从帖子文本中提取的ELM和TPB代理特征相融合。此外,本文还引入了**认知传播分数**——一个理论对齐的事后辅助分数,旨在通过将心理学上有意义的线索映射到一个单一的扩散倾向标量(即,一个源自内容的相对快速传播或“病毒式传播”可能性的指标,而非转推计数)来支持可解释性。CPS被设计为与互动无关,因为CPS的子特征排除了观测到的互动字段。观测到的互动在可用时用于传播回归监督和辅助比较,但不进入CPS计算。实践中,这意味着工程化的分支将理论操作化为可观察的语言线索,其中TPB对齐的代理特征反映了态度(例如,情感极性和确定性)、主观规范(例如,包容性代词和规范性表述)和感知行为控制(例如,指令性或说明性语言),而ELM对齐的代理特征捕捉了中心路径线索(例如,可读性和词汇多样性)和边缘路径线索(例如,强调性标点、大写和紧迫性标记)。 本研究做出了以下贡献: 1. 引入一种多分支融合架构,结合语义、修辞、立场和行为理论启发的特征,用于健康错误信息检测。 2. 将ELM和TPB构念操作化为明确的、源自文本的代理特征,以支持特征级解释。 3. 提出CPS作为一种可解释的辅助扩散倾向信号,旨在互动真实标签不可用或延迟时用于优先级排序。 4. 在三个健康相关基准数据集(Constraint、COVID–19\_FNIR和Monkeypox)上评估该框架,并通过消融分析量化每个特征分支的贡献。 通过这项研究,为开发更有效和可解释的工具来对抗网络健康错误信息奠定了基础。 ## II 相关工作与基准基线 ### II-A 基线原理与可比性边界 为定位本研究在健康错误信息文献中的位置,本节总结了最常报告用于每个基准数据集的基线模型族,涵盖经典机器学习、基于Transformer的分类器和轻量级神经架构。本节讨论的基线结果取自原始研究,因此被解释为*特定于该研究的*,因为先前的工作在预处理、标签定义、数据划分(留出法与k折交叉验证)和超参数调优程序上经常有所不同。因此,这些报告的基线用于刻画评估图景并激发我们实验所解决的方法论缺口,而不是作为跨论文的严格同类数值基准。 ### II-B Constraint COVID-19 假新闻数据集(英语)上的基线 本节总结文献中报告的每个基准数据集的基线。可比性和公平性,包括我们实施的实验与用于上下文参考的文献报告基线之间的边界,在第III-K节中处理。Constraint@AAAI-2021是一个包含10,700个标记为真实或虚假社交媒体帖子的共享任务数据集,已经建立了若干强基线[7]。原始竞赛中表现最佳的模型将XLNet与通过潜在狄利克雷分布提取的主题分布特征相结合,达到了约96.7%的F1分数[13]。这种XLNet+LDA融合优于原始的Transformer模型,展示了主题级线索的附加价值。作为非神经基线,一个在手工语言特征(n-gram、可读性指标、标点等)上训练的线性支持向量机在测试集上达到了约95.2%的加权F1分数[14]。在传统机器学习方法中,该SVM表现最佳,超越了随机森林和朴素贝叶斯等替代方案[15]。值得注意的是,数据集创建者本身报告SVM是四种经典算法中最有效的,F1分数为93.4%[7]。Constraint数据集上额外的Transformer研究包括:[16]的CT-BERT集成、[17]的预训练语言模型集成,以及[18]和[19]更广泛的Transformer比较。这些研究证实了Transformer方法在该数据集上的强大性能,并提供了超越原始共享任务基线的有用背景。为便于本文比较,XLNet+LDA模型(~96.7% F1)和语言特征SVM(~95% F1)被视为Constraint数据集的主要参考基线。 ### II-C COVID–19\_FNIR 数据集上的基线 COVID–19\_FNIR数据集包含约7,600个标记的关于COVID-19错误信息的社交媒体帖子[20]。数据集创建者报告,一个微调的DistilBERT模型,在没有辅助特征或特定领域预训练的情况下训练,达到了约93%的F1分数[21]。这一结果在后续研究中得到了证实。例如,在第一作者共同参与的先前工作中,Sikosana等[22]发现DistilBERT分类器达到了高达97%的F1分数,而使用标准词嵌入的CNN–LSTM模型达到了98-99%的准确率。传统机器学习方法在COVID–19\_FNIR上也表现具有竞争力。随机森林和SVM分类器达到了91-94%的F1分数,表明该数据集包含强大的语言线索,可以被神经和经典模型学习[21]。在比较研究中,线性SVM达到了94.4%的F1分数,一个使用Word2Vec嵌入调优的BiLSTM模型达到了99%,优于DistilBERT和RoBERTa基线[21]。纵观文献,报告的性能因划分策略和实验协议而异。这些研究用于激发在统一协议下评估的一组代表性基线(第III-K节)。进一步的研究探索了可解释的基于Transformer的方法,例如集成了SHAP解释的DistilBERT[23]。然而,这些模型优先考虑可解释性而非性能提升。传统分类器,包括逻辑回归,也被评估,但性能始终低于Transformer架构。基于这些发现,微调的DistilBERT,达到约93%的F1分数,被采用为COVID–19\_FNIR数据集的基准基线。 ### II-D Monkeypox 数据集上的基线 在mpox领域检测错误信息是一个相对较新的领域。PoxVerifi引入了一个包含225个mpox相关声明(170个真实,55个虚假)的策展数据集,并训练了一个基于BERT的分类器用于声明级错误信息检测[24]。在这个声明级基准上,该模型在10折交叉验证下达到了约96%的准确率。标签来源于受信任的公共卫生来源,包括世界卫生组织,未使用外部数据或领域适应。PoxVerifi[24]提供了上下文证据,表明Transformer编码器可以在策展的、声明级条件下区分mpox错误信息。可比性和公平性,包括哪些基线被视为上下文文献参考而非在我们的统一协议下直接可比的基准,在第III-K节中指定。 ### II-E 基线覆盖范围总结 在三个数据集中,文献提供了来自传统和神经模型族的基准。对于Constraint数据集,本文综述的最强基准之一是XLNet+LDA模型,约96.7%F1,而语言信息SVM变体达到了约95%F1[13, 14]。对于COVID–19\_FNIR,报告的结果从基于DistilBERT的分类约92-93%F1[21]到第一作者共同参与的先前工作中报告的CNN–LSTM混合模型约98-99%不等[22]。这些发现表明,在特定的数据划分、预处理程序和评估协议下,性能可以接近该语料的上限水平。对于mpox,像PoxVerifi[25]这样的系统为声明级验证提供了有用的上下文,但与本文中使用的推文级Monkeypox错误信息数据集不具有直接可比性。因此,PoxVerifi被视为上下文参考,而推文级基线被优先用于同类性能比较。总体而言,这些值提供了上下文参考点和文献报告的上界。在本文中,避免了仅基于跨论文比较(其中划分、预处理或验证方案不同)的特定于数据集的最先进声明。相反,重点在于在固定、可重现的协议下特征融合和基于心理学建模的增量价值,表VIII报告了用于直接比较的基线,第IV-G节明确说明了可比性边界。 ## III 材料与方法 ### III-A 数据集与预处理 本研究使用三个错误信息数据集:COVID–19\_FNIR[20]、Constraint[7]和Monkeypox数据集[26]。这些数据集在规模和标注丰富度上各不相同。为保持跨实验的方法论一致性,所有三个数据集均使用通用的预处理和特征工程流程进行处理。
相似文章
MMMMM:用于研究多语言多模态虚假信息机制的统一分类体系
本文提出了一种统一分类体系,用于研究社交媒体上的多语言多模态虚假信息,利用大规模数据集和基于视觉语言模型的自动标注,以揭示检测和缓解的见解。
探测、融合与可信度:面向多模态癌症分析的基础模型表征系统评估
本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。
超越二元检测:Reddit上癌症错误信息的多维度分类
本文提出了一种多维度分类法,用于描述Reddit上的癌症错误信息,评估了大型语言模型(LLMs)在注释方面的表现,发现约6%的癌症讨论包含错误信息。它识别出反复出现的叙事,如未经支持的治疗方法和对传统医学的不信任。
多模态大语言模型能否生成并检测多模态社交媒体假新闻?
EMNLP Findings 2026 的一篇论文提出了一种多智能体框架(包括文本、图像和批评者智能体),生成了 9,000 多条多模态假新闻帖子,并对 16 个开源和闭源多模态大语言模型进行了基准测试。结果发现这些模型的检测准确率尚达不到人类水平,尤其在判断图像真实性方面表现不佳。
超越并行跟踪:交互式多特征融合驱动来自非侵入性脑记录的语义重建
本文介绍了一种用于非侵入性脑记录语义重建的多特征融合框架,通过交叉注意力机制结合静态词汇(Word2Vec)和动态上下文(GPT)表示,在脑到文本解码中取得了最先进的性能。