基于可解释Transformer模型的Mpox研究自动化多标签分类

arXiv cs.CL 论文

摘要

本文提出了一种基于BERT的Mpox研究文章自动化多标签分类系统,准确率达到97%,并采用SHAP进行可解释性分析。该系统旨在帮助研究人员和医疗工作者快速找到相关信息。

arXiv:2607.26700v1 Announce Type: new 摘要:Mpox疫情仍是一个严重的公共卫生问题,世界卫生组织(WHO)报告称部分地区的病例数量正在增加。针对Mpox的研究对于疫苗开发、诊断改进、病毒进化研究以及预防未来疫情等方面至关重要。然而,大量发表的研究使得高效组织和分析信息变得困难。本研究聚焦于使用多标签分类对14590篇Mpox研究文章进行分类,涵盖疫情、疫苗接种和流行病学等关键主题。在测试的多种AI模型中,BERT表现最佳,实现了97.05%的准确率、97.67%的微观F1分数和96.46%的宏观F1分数。为了更好地理解模型的决策过程,我们使用SHAP分析了重要的单词特征和模式。结果表明,BERT能够帮助自动化Mpox研究的分类,使研究人员、政策制定者和医疗工作者更容易快速找到相关信息,从而节省时间并改善公共卫生工作。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# 基于可解释性Transformer模型的多标签Mpox研究自动化分类
来源:https://arxiv.org/html/2607.26700
\\copyyear

2023\\startpage1

\\corres

通讯作者 Tanjim Taharat Aurpa,此为示例通讯地址。

Tanjim Taharat Aurpa\\orgdiv数据科学与工程系,\\orgname前沿科技大学,孟加拉国(UFTB)[email protected] (https://arxiv.org/html/2607.26700v1/mailto:[email protected])

(日期 月 年)

###### 摘要

【摘要】 Mpox疫情仍然是一个严重的公共卫生问题,世界卫生组织(WHO)报告称,一些地区的病例仍在增加。Mpox的研究对于疫苗开发、诊断改进、病毒进化研究以及预防未来疫情等方面至关重要。然而,大量发表的研究使得高效组织和分析信息变得困难。本研究侧重于使用多标签分类方法,将14590篇Mpox研究文章归类到疫情、疫苗接种和流行病学等关键主题。在测试的不同AI模型中,BERT表现最佳,达到了97.05%的准确率、97.67%的微平均F1分数和96.46%的宏平均F1分数。为了更好地理解模型的决策过程,我们使用了SHAP来分析重要的词汇特征和模式。结果表明,BERT可以帮助自动化Mpox研究的分类,使研究人员、政策制定者和医疗工作者能够更快地找到相关信息,节省时间并改善公共卫生工作。

###### 关键词:

MPox,猴痘,BERT,可解释人工智能(XAI),SHAP

††文章类型:文章类型††期刊:期刊††卷:00

## 1 引言

Mpox,也称为猴痘,是由猴痘病毒引起的一种有害疾病。Mpox携带者可能会将病毒传播给他人。根据WHO¹¹¹https://www.who.int/news-room/fact-sheets/detail/mpox,该病毒于1951年在丹麦首次被发现。此后,许多国家都经历了这种疾病的毁灭性疫情。最近,从2022年5月到2024年8月,一种Mpox变体已传播到超过120个国家。在此次疫情期间,发现了超过十万例实验室确诊病例,220人死于Mpox感染。最近的研究已识别出Mpox病毒的多种变体,突显了该疾病的演变特性及其对公共卫生的影响。已发现两个主要分支:分支I(中非)和分支II(西非)。然而,最近出现的亚分支Ib和IIb已经合并,显示出不同的传播动态和毒力。最近病例的激增,特别是在非洲,令人担忧,Mpox被宣布为公共卫生紧急事件,世界卫生组织在2024年表达了国际关切。该病毒传播到此前接触有限的地区,如布隆迪、卢旺达和乌干达等东非国家,突显了其适应性。因此,这些不断演变的变体强调了加强监测、疫苗接种策略和公共卫生干预措施以控制Mpox传播并减轻其影响的必要性。

Mpox研究至关重要,因为该病毒可能引发大规模疫情,尤其是在医疗系统欠发达的地区。研究该病毒并创建预防和治疗方法,可以显著减轻其对全球健康的影响。此外,这项研究可以找到提供更便宜、更高效疫苗的途径,并且随着更多动物疾病传播给人类,研究Mpox有助于我们为未来的感染做好准备。近期在新地区发生的疫情突显了这项研究对于保护公众健康和在大流行开始前阻止其发生的紧迫性。现有研究主要关注该病毒的疫情、预防和疫苗接种。同样,一篇论文可能涉及这些子主题中的多个。这项工作将通过提出更好的公共卫生政策、改善我们对疫情的响应方式以及利用自然语言处理技术更好地为病毒流行做好准备,使研究人员受益。

利用现代基于Transformer的架构(如BERT、RoBERTa、ALBERT、DistilBERT、ELECTRA和XLNet)来分析近期关于Mpox的研究,是本文的主要动机。这些架构在多种NLP任务中表现出色³ (https://arxiv.org/html/2607.26700#bib.bib3),¹ (https://arxiv.org/html/2607.26700#bib.bib1),² (https://arxiv.org/html/2607.26700#bib.bib2),⁴ (https://arxiv.org/html/2607.26700#bib.bib4)等。这些Transformer模型分两步工作:模型预训练和下游任务的微调。这些模型用于许多基于多标签分类的研究。多标签分类是一个NLP问题,其中给定的输入文本被分类为多个类别,是一种通用工具。基于Transformer的架构在这一领域表现出显著性能,特别是在下游任务的微调方面。如前所述,确定了三个主要研究类别,分别是“预防相关”、“疫情相关”和“疫苗相关”。一项研究可能涉及所有这些主题,这展示了多标签分类对多样化研究主题的适应性。这使得它成为医疗专业人员、研究人员和公共卫生当局的宝贵且节省时间的工具。

可解释人工智能(XAI)是一种有价值的技术,有助于研究人员揭示深度学习黑箱。一种流行的XAI技术——SHapley Additive exPlanations(SHAP)——有助于理解对预测有贡献的重要特征、模型透明度、错误计算等。SHAP被广泛用于各个领域,包括文本分类⁵ (https://arxiv.org/html/2607.26700#bib.bib5)、多模态预测⁶ (https://arxiv.org/html/2607.26700#bib.bib6)和图像处理⁷ (https://arxiv.org/html/2607.26700#bib.bib7)等。在这项工作中,SHAP将有助于理解研究文章是如何根据哪些词汇进行分类的。

本工作的主要目标如下:

- • 通过提出一种多标签分类方法来对Mpox研究文章进行分类,从而利用现代NLP技术。
- • 探索基于Transformer的模型在将Mpox研究文章分类为疫情、预防和疫苗类别方面的有效性。
- • 从PubMed²²²https://pubmed.ncbi.nlm.nih.gov/收集与Mpox相关的研究摘要,并对其进行分析,为研究人员提供重要见解。
- • 通过应用XAI技术SHAP理解每个类别最重要的词汇特征,从而理解模型的透明度。

本工作将解决的研究问题如下:

- 1 基于Transformer的架构(例如BERT、RoBERTa)在将Mpox相关研究执行多标签分类为疫情、预防和疫苗等类别时效果如何?
- 2 SHAP能提供关于驱动Mpox相关研究文章分类的关键特征(例如词汇或短语)的哪些见解?
- 3 将多标签分类应用于Mpox研究中重叠主题时,存在哪些挑战和解决方案?
- 4 多标签分类和XAI技术如何改进管理Mpox疫情的公共卫生策略和决策?

## 2 文献综述

由于BERT在解决各种难题方面取得了非凡的成功,它引起了研究人员的极大兴趣。例如,¹² (https://arxiv.org/html/2607.26700#bib.bib12) 专注于一个Twitter数据集,预训练BERT,以改进拉脱维亚语推文的情感分析。此外,BERT在假新闻检测方面也显示出了有效性。在¹³ (https://arxiv.org/html/2607.26700#bib.bib13) 中,研究人员提出了一种混合方法,将BERT与LSTM层集成,在PolitiFact数据集上准确率提高了2.50%,在GossipCop数据集上提高了1.10%。此外,¹ (https://arxiv.org/html/2607.26700#bib.bib1) 探索了用于识别医学实体的两个BERT模型的集成,准确率显著提高了11.80%。

在¹⁴ (https://arxiv.org/html/2607.26700#bib.bib14) 中,作者在分类两个数学实体之间的关系后,使用了SHAP,使用了各种基于Transformer的架构来突出影响预测的关键特征。Rabbi等人将SHAP应用于COVID-19相关文本的多标签文本分类,其中随机森林和BERT是表现最好的分类器¹⁵ (https://arxiv.org/html/2607.26700#bib.bib15)。此外,SHAP已用于假新闻检测、真实新闻识别和问题分类任务,如⁵ (https://arxiv.org/html/2607.26700#bib.bib5) 中所探索的,涵盖了二元、多类和多标签分类场景,以展示可解释性。

Mpox是目前WHO关注的重要问题之一。因此,除了其他领域,已有许多相关工作——主要是作者对社交媒体文本进行了情感分析。在¹⁶ (https://arxiv.org/html/2607.26700#bib.bib16) 中,作者使用hydrator收集了61,862条与Mpox相关的推文,并应用VADER进行情感分析。他们的分析显示,几乎一半(46.88%)的推文为负面,其余为正面和中性。另一项工作¹⁷ (https://arxiv.org/html/2607.26700#bib.bib17) 中,作者收集了50,000条与Mpox相关的多语言推文。在这里,他们不仅使用了VADER,还使用了TextBlob来确定情感标签,然后应用了不同的机器学习模型。他们使用TextBlob标注和CountVectorizer作为向量化技术,达到了最高0.9348的准确率。一些工作对Mpox相关文本进行了主题建模。Thakur等人 (2023)¹⁸ (https://arxiv.org/html/2607.26700#bib.bib18) 使用601,432条推文进行了主题建模,并确定了总共50个主题。作者分析了平均一致性,发现主题“关于Mpox的观点和看法”的置信度值最高。在¹⁹ (https://arxiv.org/html/2607.26700#bib.bib19) 中,使用S-BERT、PCA和UMAP分析了与Mpox相关的推文中的公共卫生信息和错误信息。共收集了125,424条Mpox相关文本,并使用潜在狄利克雷分配(LDA)来确定重要主题。他们使用CamemBERT分析了情感²⁰ (https://arxiv.org/html/2607.26700#bib.bib20)。Hajjo等人(2025)⁸ (https://arxiv.org/html/2607.26700#bib.bib8) 全面回顾了Mpox的流行病学、诊断和治疗,绘制了关键的宿主-病原体相互作用图,揭示了病毒如何逃逸先天免疫。他们的网络药理学分析确定了用于新药发现的关键宿主蛋白靶点,同时强调了人工智能和大数据在监测病毒突变中的作用。研究¹¹ (https://arxiv.org/html/2607.26700#bib.bib11) 提出了一种新颖的基于流行病学信息的粒子滤波模型(EI-PF),该模型将确定性SEIRD框架与随机参数估计以及独特的二元泊松分布相结合。通过引入惩罚因子来执行流行病学约束,该模型消除了不规则的粒子轨迹,并在2022年美国猴痘疫情数据上实现了比标准替代方法更优的拟合和预测准确性。Hayman等人⁹ (https://arxiv.org/html/2607.26700#bib.bib9) 强调了近期Mpox疫情的全球影响,概述了环境破坏、森林破碎化和区域社会政治因素如何加剧人畜共患病的溢出风险。他们倡导跨学科的“同一健康”框架,优先考虑可持续生态实践、当地社区信任和全球资源公平,以减轻未来的流行病。本文¹⁰ (https://arxiv.org/html/2607.26700#bib.bib10) 介绍了一个基于三维马尔可夫链的随机SPIR仓室模型,推导出关键流行病学描述符的算法公式,如疫情规模、传播源影响和死亡时间。通过将增强的状态空间公式与粒子滤波相结合,根据经验性Mpox数据估计随时间变化的参数,作者显著提高了预测准确性和在线疫情评估,优于传统的恒定参数方法。

## 3 材料与方法

### 3.1 基本概念

#### 3.1.1 基于Transformer的双向编码器表示(BERT)

本研究利用了基于Transformer的双向编码器表示(BERT)。该基于Transformer的架构实现了注意力机制。BERT的两个主要组成部分如下:

- • 预训练BERT:BERT通过两个主要任务进行预训练:掩码语言建模(MLM)和下一句预测(NSP)。在MLM中,文本中的随机标记被掩码,模型的目标是预测这些标记,这有助于它学习语言的 双向表示。另一方面,NSP通过判断一个句子是否逻辑上紧随另一个句子,使模型能够理解句子之间的关系。BERT的训练数据包括英文维基百科(不包括列表、标题和表格)以及包含8亿词的BooksCorpus。
- • 微调BERT:BERT通常用于涉及单个句子或句子对作为输入的下游任务。它从捕捉通用语言理解的预训练参数开始,随后针对特定任务(如分类、问答或情感分析)的标注数据进行微调。在这项工作中,BERT被微调用于多标签文本分类,以预测研究论文的合适标签。

图1 (https://arxiv.org/html/2607.26700#S3.F1) 描述了用于多标签研究文章分类的BERT模型架构。

引用图注图 1:提出的BERT模型
#### 3.1.2 SHapley Additive exPlanations(SHAP)

SHAP(SHapley Additive exPlanations)是一个强大的工具,可以帮助我们理解模型决策中哪些特征最重要。它通过基于Shapley值(一种源于博弈论的概念,确保团队成员之间公平分配功劳——不过在这里,“团队成员”是我们的特征)为每个特征分配重要性分数来工作。在我们的案例中,SHAP有助于解释研究摘要的不同方面如何在识别和提取关键类别中发挥作用。

本文引入了SHAP来解释研究文章多标签分类的决策过程。通过分析SHAP值,可以识别模型预测中最具影响力的特征,以及它们在识别实体及其关系中的作用。这种方法提高了分类结果的透明度,并通过强调最重要的特征来帮助优化模型。

- • 特征重要性:SHAP有助于识别哪些特征(例如特定词汇)在准确确定类别中起最大作用。
- • 模型透明度:使用SHAP通过揭示最重要的特征及其预测背后的原因,使模型更易于理解。这些解释提高了其可靠性,使其成为改进决策的有用工具。
- • 错误分析:SHAP通过显示哪些特征导致错误预测来帮助指出错误,从而允许对模型进行有针对性的改进。引用图注图 2:SHAP算法的工作原理图2 (https://arxiv.org/html/2607.26700#S3.F2)

相似文章

应用于大语言模型的可解释性研究:对比分析

arXiv cs.CL

一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。

基于可解释机器学习与临床生物标志物的阿尔茨海默病早期检测:利用阿尔茨海默病神经影像学倡议(ADNI)数据集的多分类研究

arXiv cs.AI

本研究利用ADNI数据集中的八项临床生物标志物,构建了一个结合SHAP可解释性的XGBoost分类器,实现对阿尔茨海默病的三分类检测(认知正常、轻度认知障碍、AD),在留出测试集上达到宏观AUC 0.982、Cohen's kappa 0.909。SHAP分析表明,CDR整体评分是认知正常和轻度认知障碍的主导预测因子,而CDR-SB与MMSE共同驱动了AD的分类判别。