超越二元检测:Reddit上癌症错误信息的多维度分类
摘要
本文提出了一种多维度分类法,用于描述Reddit上的癌症错误信息,评估了大型语言模型(LLMs)在注释方面的表现,发现约6%的癌症讨论包含错误信息。它识别出反复出现的叙事,如未经支持的治疗方法和对传统医学的不信任。
arXiv:2607.12383v1 公告类型: new
摘要: 社交媒体上与癌症相关的讨论为信息交流和同伴支持提供了重要空间,但也促进了可能影响预防、筛查和治疗决策的错误信息的传播。现有关于癌症错误信息的研究通常依赖于狭窄的定义、小规模数据集或二元标签框架。我们引入了一种多维度分类法,用于描述Reddit上关于乳腺癌、肺癌、结肠癌和前列腺癌讨论中的癌症错误信息。该分类法涵盖七个维度,包括错误信息存在性、信息类型、风险等级、立场和主题焦点。利用专家标注的数据,我们评估了多个大型语言模型(LLMs)用于可扩展的错误信息标注,并分析了Reddit社区中的癌症错误信息。我们的结果表明,癌症相关错误信息约占Reddit癌症讨论的6%,在不同社区和错误信息主题之间存在显著差异。少样本提示显著提高了分类性能,尤其是在细粒度分类维度上。我们还识别出反复出现的错误信息叙事,集中于未经支持的治疗方法、对传统医学的不信任以及关于诊断和筛查的误导性声明。我们的分类法、数据集和发现为在线癌症错误信息的多维度建模提供了基础。
查看缓存全文
缓存时间: 2026/07/15 04:22
# 超越二元检测:Reddit上癌症虚假信息的多维分类体系
来源:https://arxiv.org/html/2607.12383
Aria Pessianzadeh¹, Pooriya Jamie², Naima Sultana¹, Georgia Himmelstein², Yuliya Zektser², Patricia Ganz², Homa Hosseinmardi², Amir Ghasemian², Rezvaneh Rezapour¹
¹德雷塞尔大学,²加州大学洛杉矶分校
通讯:\{ap3943, shadi\.rezapour\}@drexel\.edu
###### 摘要
社交媒体上关于癌症的讨论为信息交流与同伴支持提供了重要空间,但也助长了虚假信息的传播,这些信息可能影响预防、筛查和治疗决策。现有关于癌症虚假信息的研究往往依赖于狭隘的定义、小规模数据集或二元标签框架。我们引入了一个多维分类体系,用于描述Reddit上乳腺癌、肺癌、结肠癌和前列腺癌讨论中的癌症虚假信息。该分类体系涵盖七个维度,包括虚假信息存在性、信息类型、风险等级、立场和主题焦点。利用专家标注的数据,我们评估了多种大型语言模型(LLM)在可扩展的虚假信息标注中的表现,并分析了Reddit社区中的癌症虚假信息。我们的结果显示,癌症相关虚假信息约占Reddit癌症讨论的6%,在不同社区和虚假信息主题间存在显著差异。少样本提示显著提升了分类性能,尤其是在更细微的分类维度上。此外,我们识别出反复出现的虚假信息叙事,主要围绕未经证实的疗法、对传统医学的不信任以及关于诊断和筛查的误导性说法。我们的分类体系、数据集和研究结果为在线癌症虚假信息的多维建模奠定了基础。
# 超越二元检测:Reddit上癌症虚假信息的多维分类体系
Aria Pessianzadeh¹, Pooriya Jamie², Naima Sultana¹, Georgia Himmelstein², Yuliya Zektser², Patricia Ganz², Homa Hosseinmardi², Amir Ghasemian², Rezvaneh Rezapour¹
¹德雷塞尔大学,²加州大学洛杉矶分校
通讯:\{ap3943, shadi\.rezapour\}@drexel\.edu
## 1 引言
社交媒体平台的快速增长改变了人们寻求、分享和参与健康相关信息的方式Moorhead 等 (2013 (https://arxiv.org/html/2607.12383#bib.bib62));Jia 等 (2021 (https://arxiv.org/html/2607.12383#bib.bib61));Bouzoubaa 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib4))。除了作为医学信息来源之外,这些平台还提供了情感支持Pessianzadeh 等 (2026 (https://arxiv.org/html/2607.12383#bib.bib80))、经验知识分享Phadke (2026 (https://arxiv.org/html/2607.12383#bib.bib82))以及关于健康状况和治疗方案的讨论Aghakhani and Rezapour (2026 (https://arxiv.org/html/2607.12383#bib.bib83))。这些功能在癌症社区中尤为重要,因为个体经常面临巨大的不确定性、情感脆弱性和复杂的护理决策Harkin 等 (2020 (https://arxiv.org/html/2607.12383#bib.bib85));Tripathi 等 (2022 (https://arxiv.org/html/2607.12383#bib.bib86))。与此同时,社交媒体也促进了癌症相关虚假信息的传播Johnson 等 (2022 (https://arxiv.org/html/2607.12383#bib.bib19));Loeb 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib8));Ghenai and Mejova (2018 (https://arxiv.org/html/2607.12383#bib.bib84)),这些相同的背景因素可能放大其影响Swire-Thompson and Johnson (2024 (https://arxiv.org/html/2607.12383#bib.bib7));Wu and Pei (2022 (https://arxiv.org/html/2607.12383#bib.bib64));Wang 等 (2019 (https://arxiv.org/html/2607.12383#bib.bib63))。接触到关于癌症预防、筛查、诊断或治疗的误导性或虚假信息可能会延误治疗,降低对循证干预措施的依从性,并增加采用有害或无效疗法的可能性Loeb 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib8));Johnson 等 (2022 (https://arxiv.org/html/2607.12383#bib.bib19))。此外,癌症相关虚假信息通常获得不成比例的高在线参与度Loeb 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib8));Meteran 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib51));Johnson 等 (2022 (https://arxiv.org/html/2607.12383#bib.bib19))。先前的研究记录了在线癌症虚假信息的广泛范围,包括未经证实的疗法Fridman 等 (2025 (https://arxiv.org/html/2607.12383#bib.bib11))、饮食干预Warner 等 (2022 (https://arxiv.org/html/2607.12383#bib.bib45))、补充剂Wilner and Holton (2020 (https://arxiv.org/html/2607.12383#bib.bib46))、神奇疗法以及针对制药公司和医疗机构的阴谋论叙事Warner 等 (2021 (https://arxiv.org/html/2607.12383#bib.bib18));Varet 等 (2025 (https://arxiv.org/html/2607.12383#bib.bib48))。其他研究则考察了使此类内容具有说服力的修辞策略,包括情感叙事Trivedi 等 (2022 (https://arxiv.org/html/2607.12383#bib.bib47))、轶事证据Loeb 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib8))和不信任框架Peng 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib53))。
自然语言处理(NLP)和计算社会科学领域的并行研究通过污名、情感表达、焦虑和社会支持的视角,考察了Reddit和Twitter社区中癌症相关的社交媒体讨论Rajwal 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib1));Lal 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib5));Pierce 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib9));Liu 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib3))。这些研究共同展示了在线癌症对话的丰富性和社会影响。
尽管取得了这些进展,现有关于癌症虚假信息的研究仍然缺乏一个用于大规模表征的统一计算框架。现有研究通常依赖于定性分析、小规模数据集或二元虚假信息标签,这些标签未能捕捉虚假信息是如何被框架化、语境化或修辞性地表达的Swire-Thompson and Johnson (2024 (https://arxiv.org/html/2607.12383#bib.bib7))。因此,捏造的主张、误导性的解释、轶事证据和语境化的不确定性之间的重要区别仍未得到充分探索Wardle and Derakhshan (2017 (https://arxiv.org/html/2607.12383#bib.bib27))。
为了解决这些局限性,我们基于既定的虚假信息分类体系,并通过专家反馈进行完善,开发了一个癌症虚假信息的多维分类体系Wardle and Derakhshan (2017 (https://arxiv.org/html/2607.12383#bib.bib27))。该框架涵盖了诸如癌症阶段、虚假信息类型、风险等级、立场和主题焦点等维度。利用这个分类体系,我们构建了一个专家标注的数据集,评估了多种大型语言模型(LLM)在虚假信息分类中的表现,并将该框架应用于超过13万条来自乳腺癌、肺癌、结肠癌和前列腺癌社区的Reddit帖子。我们的研究结果显示,癌症相关虚假信息约占Reddit癌症讨论的6%,在不同社区和虚假信息主题间存在显著差异。少样本提示显著提升了分类性能,尤其是在更细微的分类维度上,这证明了用于健康虚假信息研究的可扩展自动标注的可行性。最后,我们的分析揭示,Reddit上的癌症虚假信息主要集中在诊断和筛查主张、对传统治疗的不信任、未经证实的医疗建议以及违背科学共识的观点上。
我们的贡献有三方面。首先,我们引入了一个全面的多维分类体系,用于建模在线讨论中的癌症虚假信息。其次,我们开发并发布了一个专家知情的标注数据集,涵盖四个主要的Reddit癌症社区。第三,我们对Reddit上的癌症虚假信息进行了大规模计算分析,揭示了超越二元虚假信息检测的语言、主题和语境模式。通过将健康虚假信息研究与计算社交媒体分析相结合,我们的工作为在线社区中癌症虚假信息的细粒度NLP分析奠定了基础。(我们的代码和匿名化数据将会发布。)
## 2 相关工作
概念化与表征癌症虚假信息。近期研究强调,由于癌症具有高度的情感风险、治疗不确定性和严重的行为后果,它是虚假信息研究的一个关键领域Swire-Thompson and Johnson (2024 (https://arxiv.org/html/2607.12383#bib.bib7))。在该文献中,癌症虚假信息通常被定义为虚假、未经证实、误导性或与当前科学共识不一致的健康相关内容Lazard 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib23));Johnson 等 (2022 (https://arxiv.org/html/2607.12383#bib.bib19))。先前的研究已经在未经证实的疗法、未被支持的预防策略以及夸大的干预主张中识别出虚假信息Loeb 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib8));Yussof 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib10));Fridman 等 (2025 (https://arxiv.org/html/2607.12383#bib.bib11)),包括替代疗法、补充剂和草药癌症疗法Yussof 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib10));Fridman 等 (2025 (https://arxiv.org/html/2607.12383#bib.bib11))。现有研究进一步表明,癌症虚假信息并非单一类型。Yussof 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib10)) 区分了不准确的和捏造的虚假信息,而Fridman 等 (2025 (https://arxiv.org/html/2607.12383#bib.bib11)) 表明,误导性内容往往结合了事实和虚假主张,这使得二元真假标注变得复杂。先前的研究强调,需要将虚假信息与诸如辟谣、讽刺或关于替代医学的中性讨论等话语区分开来,在这些讨论中,提及并不等同于认可Fridman 等 (2025 (https://arxiv.org/html/2607.12383#bib.bib11))。跨研究来看,食物和生活方式主张、替代医学和补充剂是主导主题Yussof 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib10))。
除了主题类别之外,先前研究表明,癌症虚假信息常常嵌入更广泛的叙事和说服形式中。常见的模式包括神奇疗法建议、劝阻常规治疗以及针对医生或制药公司的不信任叙事Warner 等 (2021 (https://arxiv.org/html/2607.12383#bib.bib18))。虚假治疗主张进一步依赖于个人叙事、机构不信任和隐喻框架(如排毒或战斗)等说服策略Peng 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib53));Kamali 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib54));Loeb 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib8));Lazard 等 (2026 (https://arxiv.org/html/2607.12383#bib.bib12));Baker (2025 (https://arxiv.org/html/2607.12383#bib.bib55))。这些发现表明,癌症虚假信息不仅应被理解为不准确的内容,还应被视为具有修辞说服力的话语,尽管信息质量低下,但仍能吸引参与Komsany 等 (2026 (https://arxiv.org/html/2607.12383#bib.bib52))。
虚假信息的危害与缺口。近期研究强调,癌症虚假信息之所以后果严重,不仅因为它不准确,更因为它可能产生切实的伤害。已识别的危害包括延误医疗、采用无效或有毒的治疗方法、经济损失,以及与合法疗法产生有害交互Loeb 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib8))。虚假信息研究认为,有害内容不仅应根据事实准确性评估,还应考虑可操作性、可信度、传播潜力和剥削能力等因素Sehat 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib13));Tran 等 (2019 (https://arxiv.org/html/2607.12383#bib.bib15), 2020 (https://arxiv.org/html/2607.12383#bib.bib16))。相关的健康虚假信息研究进一步强调了谣言、不完整信息以及对医学指导的怀疑在塑造有害解释和行为中的作用Alvarez-Galvez 等 (2025 (https://arxiv.org/html/2607.12383#bib.bib17))。
与此同时,关于在线癌症讨论的NLP研究主要关注相关但非虚假信息本身的问题Podină 等 (2021 (https://arxiv.org/html/2607.12383#bib.bib2));Podina 等 (2023 (https://arxiv.org/html/2607.12383#bib.bib72))。现有工作考察了患者关切、情感表达、实体提取、诊断过程中的焦虑、肺癌讨论中的污名以及Reddit上的癌症幸存者话语Rajwal 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib1));Lal 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib5), 2025 (https://arxiv.org/html/2607.12383#bib.bib6));Pierce 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib9));Liu 等 (2024 (https://arxiv.org/html/2607.12383#bib.bib3));Podină 等 (2021 (https://arxiv.org/html/2607.12383#bib.bib2))。这些工作凸显了NLP在建模癌症相关社交媒体讨论中的价值,但缺乏系统地表征癌症虚假信息的框架。
在这一文献基础上,我们引入了一个多维分类体系和框架,用于大规模分析Reddit讨论中的癌症虚假信息。
## 3 方法
### 3.1 数据收集
Reddit 因其长篇、社区驱动的讨论,能够捕捉细微的患者经历和信息交流,为研究健康话语提供了宝贵环境De Choudhury and De (2014 (https://arxiv.org/html/2607.12383#bib.bib25));Sarker 等 (2015 (https://arxiv.org/html/2607.12383#bib.bib26))。为了考察癌症虚假信息,我们收集了与四种癌症类型相关的社区讨论,这些类型是与领域专家协商后选定的:**乳腺癌**、**肺癌**、**结肠癌**和**前列腺癌**。我们为每个类别确定了相关的Reddit社区,共得到24个子版块。数据通过ArcticshiftHeitmann (2025 (https://arxiv.org/html/2607.12383#bib.bib21)) 获取,该工具提供了对历史Pushshift存档的访问接口Baumgartner 等 (2020 (https://arxiv.org/html/2607.12383#bib.bib20))。总共收集了243,538条帖子。我们移除了空白帖子、少于五个词的帖子、由自动账户(如“AutoModerator”)发布的内容,以及标记为已删除或移除的帖子,以保护用户隐私,最终得到134,219条帖子的数据集。表A1 (https://arxiv.org/html/2607.12383#A1.T1) 列出了包含的子版块。
### 3.2 癌症虚假信息分类体系
我们与领域专家合作构建了一个多维框架,用于分析Reddit上癌症相关的虚假信息。我们的目标不是将虚假信息视为二元现象,而是对其结构、传播角色和潜在影响进行表征。为了操作化这些区分,我们开发了一个包含七个互补维度的标注分类体系(表1 (https://arxiv.org/html/2607.12383#S3.T1))。
**虚假信息存在性**。该维度捕捉帖子是否包含癌症相关的虚假信息。遵循先前的健康虚假信息。相似文章
MMMMM:用于研究多语言多模态虚假信息机制的统一分类体系
本文提出了一种统一分类体系,用于研究社交媒体上的多语言多模态虚假信息,利用大规模数据集和基于视觉语言模型的自动标注,以揭示检测和缓解的见解。
探测、融合与可信度:面向多模态癌症分析的基础模型表征系统评估
本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。
一种多分支特征融合方法,用于健康虚假信息检测与传播
本文介绍了一种多分支特征融合框架,用于检测和传播健康虚假信息,整合了语义、修辞和心理学线索,在基准数据集上表现出色。
从重复到识别:虚假信息叙事的归纳发现
本文引入了一个用于无监督叙事标签生成的三层评估框架,并比较了基于聚类和基于图社区的方法来发现虚假信息叙事,同时发布了经过人工验证的标签以支持分类法的开发。
在辩论中辨别是非:中文有害迷因的归因分析
本文介绍了Ex-ToxiCN-MM——首个中文有害迷因解释数据集,以及知识库C-HarmKB和归因分析框架RIKE,通过考虑文化背景和语义模糊性,提升有害迷因的可解释检测能力。