用于口腔癌筛查的鲁棒轻量级深度学习模型
摘要
本文介绍了针对基于智能手机的口腔癌筛查的优化轻量级深度学习模型,通过使用多样化的多中心数据集,在实现高性能的同时保持了可解释性和鲁棒性。
arXiv:2608.21583v1 公告类型:新
摘要:口腔癌是中低收入国家的主要死因,那里专科医生的短缺延迟了诊断。虽然通过智能手机进行即时筛查提供了一种可扩展的解决方案,但在资源受限的环境中开发稳健的AI面临重大挑战,包括训练数据中的类别不平衡、数据质量的变化以及边缘设备的计算限制。在本文中,我们介绍了针对基于智能手机的口腔癌筛查的轻量级深度学习模型的优化。使用一个多样化的、多中心的回顾性数据集,包含大约30,000张在十年内获取的图像,我们系统地评估了最先进的卷积、transformer和混合架构。通过严格的流程消融,我们证明直接针对边缘优化混合架构严格优于计算密集型范式,如大型模型或知识蒸馏。此外,可解释性分析和模拟噪声压力测试表明,系统锚定于临床特征,并对非结构化传感器噪声保持鲁棒性,尽管对脉冲比特错误存在脆弱性。在保留测试集中,我们优化的MobileViTv2模型达到了平均灵敏度83.2 $\pm$ 1.5%和平均特异性86.0 $\pm$ 0.8%,其中最佳模型表现出87.4%的灵敏度、86.5%的特异性,以及相对于专家标签的关键阴性预测值97.2%。这些结果证实,通过有针对性的架构选择和简化的优化,可解释且鲁棒的轻量级AI模型在边缘部署方面展现出巨大潜力,以实现初级保健环境中的自动化分诊。
查看缓存全文
缓存时间: 2026/08/25 04:19
# 面向口腔癌筛查的鲁棒轻量级深度学习模型 来源:https://arxiv.org/html/2608.21583 1同等贡献 2通讯作者 Aakash Shedsale1单位:印度科学研究所 [email protected] Tejashree Subramanya1单位:印度科学研究所 [email protected] Mohd. Azfar单位:印度科学研究所 [email protected] Praveen Birur单位:KLES牙科学院 [email protected] Debnath Pal单位:印度科学研究所 [email protected] Shankararama Sharma单位:印度科学研究所 [email protected] Anupama Shetty单位:Biocon基金会 [email protected] Rajesh Sundaresan单位:印度科学研究所 [email protected] ###### 摘要 口腔癌是中低收入国家的主要死亡原因之一,专业人员短缺导致诊断延误。基于智能手机的即时筛查提供了一种可扩展的解决方案,但在资源受限环境中开发鲁棒的AI面临重大挑战,包括训练数据中的类别不平衡、多变的数据质量以及边缘设备上的计算限制。本文提出了针对智能手机口腔癌筛查的轻量级深度学习模型优化方案。利用约十年间获取的约30,000张图像构成的多中心回顾性多样化数据集,我们系统评估了最先进的卷积、Transformer和混合架构。通过严格的流程消融研究,我们证明直接为边缘设备优化混合架构严格优于计算密集型范式,例如大型模型或知识蒸馏。此外,可解释性分析和模拟噪声压力测试揭示,尽管对脉冲比特错误存在脆弱性,系统仍能锚定临床特征并保持对非结构化传感器噪声的鲁棒性。在留出测试集中,我们优化的MobileViTv2模型实现了平均灵敏度83.2±1.5%和平均特异性86.0±0.8%,最佳模型表现出87.4%的灵敏度、86.5%的特异性,以及相对于专家标签的关键阴性预测值97.2%。这些结果证实,通过针对性的架构选择和精简的优化,可解释且鲁棒的轻量级AI模型在边缘部署方面展现出巨大潜力,能够在初级保健环境中实现自动分诊。 ###### 关键词: 口腔癌筛查、人工智能、轻量级模型、类别不平衡、可解释性、鲁棒性 ## I 引言 口腔癌是重大的公共卫生挑战,也是中低收入国家的主要死亡原因之一。仅印度每年就有超过140,000例新病例被诊断,其中大多数因获得专科护理的机会有限而在晚期被检测出来[1 (https://arxiv.org/html/2608.21583#bib.bib1),2 (https://arxiv.org/html/2608.21583#bib.bib2)]。尽管口腔视诊是检测口腔潜在恶性疾患(OPMD)的既定方法,但口腔癌发病前存在无症状但临床可见的口腔病变[3 (https://arxiv.org/html/2608.21583#bib.bib3),4 (https://arxiv.org/html/2608.21583#bib.bib4)],现场研究表明,初级保健工作者的敏感性存在差异,有时低至43.6%(与专家相比)[5 (https://arxiv.org/html/2608.21583#bib.bib5)]。这一诊断差距突显了对自动化、即时辅助工具的迫切需求。 为应对此问题,近期研究已证明了结合深度学习的智能手机成像在即时分类口腔病变方面的可行性[5 (https://arxiv.org/html/2608.21583#bib.bib5),6 (https://arxiv.org/html/2608.21583#bib.bib6),7 (https://arxiv.org/html/2608.21583#bib.bib7),8 (https://arxiv.org/html/2608.21583#bib.bib8)]。然而,这些工作大多依赖小型、精选的数据集,并且缺乏对模型在现实世界约束下表现的系统评估。在现实世界的初级保健环境中,数据受到类别不平衡(正常病例远多于可疑病例)和物理采集伪影(如模糊、光照不良和相机角度各异)的严重影响。目前,缺乏评估轻量级边缘AI架构针对这些特定现实世界挑战的鲁棒性和可解释性的框架。 在本研究中,我们通过系统性地开发和优化用于口腔癌筛查的鲁棒、轻量级深度学习系统来弥合这一差距。我们使用了十年间收集的约30,000张智能手机捕获图像构成的多中心回顾性多样化数据集。我们重点介绍了数据集中固有的技术挑战,并展示了如何有效利用它来构建轻量级模型。 本文的主要贡献在于: - •边缘优化架构识别:我们对最先进的卷积、Transformer和混合架构进行了严格评估,确定MobileViTv2为最佳推理引擎。它成功地在Transformer的全局上下文感知与卷积层的局部特征提取之间取得了平衡。 - •精简流程消融:我们通过严格的消融研究证明,在真实标签上直接优化轻量级模型优于计算密集型的大型模型范式。我们明确证实知识蒸馏引入了开销,但性能没有显著提升。 - •可解释性验证:我们通过GradCAM++和多尺度注意力滚动验证了系统的诊断完整性,证实网络在很大程度上将预测锚定在标注的临床特征上,而非虚假的背景或硬件伪影。 - •硬件压力测试与临床有效性:我们针对模拟的硬件引起的信号降级(例如,低光传感器噪声、脉冲比特错误)对系统的操作边界进行了压力测试。最终,我们提出了一个鲁棒的框架,通过设备端推理能力实现了接近专家水平的分诊(87.4%的灵敏度,97.2%的阴性预测值)。 ## II 材料与方法 ### II-A 回顾性数据 使用回顾性数据集来开发、调整和评估AI模型。为确保对模型泛化能力进行稳健评估,清洗后的数据集被划分为用于模型优化的训练集、用于模型检查点保存的验证集,以及用于最终性能基准测试的严格留出测试集。 #### II-A1 数据收集 数据集包含来自Biocon基金会于2011年至2023年在印度北部、东北部和南部各邦开展的口腔癌外展项目的图像。这些项目主要针对农村人口。至关重要的是,从系统角度来看,这些图像由前线卫生工作者使用异构消费级智能手机(包括HTC、摩托罗拉、小米和三星设备)捕获。摄像头分辨率在500万到1600万像素之间。这种硬件多样性固有地引入了真实世界的采集变化,如不同的传感器噪声特征、颜色校准、分辨率和焦距,为评估边缘AI模型在多样化采集条件下的鲁棒性提供了理想的试验台。 #### II-A2 数据描述 原始数据集包含31,601张图像,由两名口腔医学专家进行标注。作为严格质量控制流程的一部分,在模型训练前移除了统计上相同的重复图像(n=126)和非诊断性图像(例如,严重模糊、失焦或嘴巴张开不足)。最终清洗后的数据集包含29,574张图像,每张图像都有关联的临时临床诊断,随后被映射到二元分类方案中:可疑和不可疑(表II (https://arxiv.org/html/2608.21583#S2.T2))。可疑类别包括需要转诊的口腔病变(从潜在恶性疾患到癌)。相反,不可疑类别包括正常解剖结构、正常变异和良性表现。这种聚合分类在阳性和阴性类别内部都引入了显著的类内方差,对深度学习(DL)模型构成了非平凡的特征提取挑战。 表I:临时诊断标签分类 表II:展示真实世界类别不平衡的数据集划分 #### II-A3 数据划分与类别不平衡 精选后的数据集按60-20-20的比例划分为训练集、验证集和测试集(表II (https://arxiv.org/html/2608.21583#S2.T2))。代表真实筛查场景,数据集表现出严重的类别不平衡(可疑与不可疑图像的比例约为1:5),这需要在训练期间采用针对性的优化策略。 ### II-B 轻量级AI架构 为确保生成的模型在预算智能手机上进行边缘部署时在计算上可行,我们将架构搜索范围限制在参数量低于750万的轻量级模型。我们评估了六种不同的架构(表III (https://arxiv.org/html/2608.21583#S2.T3)),涵盖卷积神经网络(EfficientNetV2-B0、MobileNetV3-Large、NASNet-Mobile)、纯视觉Transformer(DeiT-Ti)和混合CNN-Transformer模型(MobileViTv2、EdgeNeXt-S)[9 (https://arxiv.org/html/2608.21583#bib.bib9),10 (https://arxiv.org/html/2608.21583#bib.bib10),11 (https://arxiv.org/html/2608.21583#bib.bib11),12 (https://arxiv.org/html/2608.21583#bib.bib12),13 (https://arxiv.org/html/2608.21583#bib.bib13),14 (https://arxiv.org/html/2608.21583#bib.bib14)]。这种选择使我们能够系统地比较CNN的归纳偏置与Transformer在资源受限环境中的全局上下文建模。 表III:评估的轻量级AI模型摘要 模型 类型 参数量 输入尺寸 关键设计 MobileViTv2-1.0 混合型 4.9M 256x256 可分离自注意力,高效上下文学习 EdgeNeXt-S 混合型 5.6M 256x256 自适应卷积和分割深度转置注意力(SDTA) DeiT-Ti Transformer 5.0M 224x224 基于蒸馏的训练,采用教师-学生框架 NASNet-Mobile CNN 5.3M 512x512 神经架构搜索(NAS)设计,使用深度可分离卷积 MobileNetV3-L CNN 5.4M 512x512 反向残差、挤压激励模块、h-swish激活 EfficientNetV2 CNN 7.1M 512x512 融合MBConv块与挤压激励,提升效率 ### II-C 实验设置 #### II-C1 训练基础设施与超参数 所有模型和消融研究均在配备3个NVIDIA RTX 3090 GPU的本地计算节点上使用PyTorch 2.3框架进行训练。模型使用ImageNet预训练权重[15 (https://arxiv.org/html/2608.21583#bib.bib15)]初始化。输入图像使用ImageNet的通道均值和标准差进行归一化,并通过双三次插值与角对齐进行调整大小。训练进行50个epoch,批量大小为32,并选择验证性能最佳的检查点用于测试集评估。每个实验配置使用不同的固定随机种子重复10次,并报告测试集上观察到的性能的平均值和方差。 #### II-C2 用于真实世界鲁棒性的数据增强 为模拟智能手机捕获图像的高可变性并防止过参数化,应用了常规的几何和光度增强,包括放大、色彩抖动和水平/垂直翻转,以及-10°到10°之间的随机旋转。 此外,为鼓励轻量级模型严格关注口腔区域而非无关的背景伪影,我们探索了由Segment Anything Model(SAM)[16 (https://arxiv.org/html/2608.21583#bib.bib16)]生成的边界框作为增强时是否能提高性能。由于并非所有图像都有准确的边界框,SAM以“一切”模式部署,生成用于移除非诊断区域的粗略掩码。需要指出的是,SAM仅在离线训练流程中使用,并非推理工作流的一部分。 #### II-C3 图像质量重加权 初级保健环境中捕获的智能手机图像常存在光照不佳和焦点不一致的问题。为研究将感知图像质量集成到损失函数中是否能强调从高质量图像学习并惩罚从低质量图像学习,我们探索了使用两种无参考图像质量评估(IQA)指标进行重加权的策略:自然图像质量评估器(NIQE)和CLIP-IQA[17 (https://arxiv.org/html/2608.21583#bib.bib17),18 (https://arxiv.org/html/2608.21583#bib.bib18)]。 NIQE评估偏离自然场景统计(NSS)的程度,产生一个标量分数,其中较低值表示较高质量。在训练期间,NIQE分数的倒数被集成到损失函数中,以动态降低低质量图像的权重。相反,CLIP-IQA基于与自然图像先验的语义一致性评估感知质量。通过使用CLIP-IQA分数作为权重因子,我们测试了高级特征理解是否能指导模型优先处理感知上更接近高质量参考的图像。 #### II-C4 处理系统性类别不平衡 回顾性数据集表现出筛查环境中典型的系统性类别不平衡,训练集中每五张不可疑图像对应一张可疑图像(2,932 vs. 14,812)。为防止模型退化为多数类预测,我们系统评估了五种缓解策略: - •随机欠采样:对多数类(不可疑)进行随机欠采样以匹配少数类数量。 - •随机过采样:对少数类(可疑)进行随机过采样。 - •加权交叉熵(WCE):WCE通过对损失按类别频率的倒数加权,对少数类误分类分配更高的惩罚[19 (https://arxiv.org/html/2608.21583#bib.bib19)]:WCE(p;θ) = -w₀(1 - p_t)log(1 - p(θ)) - w₁ p_t log(p(θ)) (1) 其中 p_t ∈ {0,1} 表示真实标签(1代表可疑),p(θ)是预测概率,w₀, w₁是类别权重。按照训练划分(表II (https://arxiv.org/html/2608.21583#S2.T2))上的逆频率方案 w_c = N / (2N_c),它们被设置为 w₀ = 0.60(不可疑)和 w₁ = 3.03(可疑)。 - •焦点损失:为防止易于分类的背景样本主导梯度,焦点损失降低被正确分类样本的权重,并专注于难样本[20 (https://arxiv.org/html/2608.21583#bib.bib20)]:FL(p;θ) = -(1 - p_t)(p(θ))^γ log(1 - p(θ)) - (p_t)(1 - p(θ))^γ log(p(θ)) (2) 其中 γ 是聚焦参数,设置为 γ = 2。 - •平衡混合:一种混合正则化和采样技术,同时执行基于实例和类别平衡的采样[21 (https://arxiv.org/h
相似文章
基于卷积神经网络和数据增强的图像分析在肺癌相关病理检测中的人工智能算法:文献系统性映射
本论文系统综述了人工智能和深度学习在肺癌早期检测中的应用,特别是使用数据增强的卷积神经网络进行图像分析。论文分析了96篇文章,强调了临床实施中的潜力和挑战。
基于优化深度学习与 LLM 驱动智能 AI 在计算受限系统上进行膝关节骨关节炎严重程度分级
本文介绍了一种用于分级膝关节骨关节炎严重程度的自动化诊断系统,该系统使用通过 TensorFlow Lite 部署在边缘设备上的优化 ResNet-18 模型。它集成了使用 Gemini 2.0 Flash 的大型语言模型(LLM)接口,在提供结构化解释性发现的同时,保持了在资源受限环境下的离线能力。
从繁多到有意义:利用大语言模型进行特征引导的零样本慢性肾病筛查
本研究提出了一种基于特征引导的零样本框架,利用大语言模型进行早期慢性肾病筛查,在异构数据集上使用最少的社区可获取特征实现了一致的改进。
牙科医疗中的大型AI模型:从通用系统到领域专用基础模型
本系统范围综述审视了牙科医疗中三类大型AI模型:语言生成模型、判别式视觉基础模型和牙科专用基础模型,分析了97项研究,表明通用模型和领域专用模型发挥互补作用,集成流水线优于单一模型方法。
资源受限农村环境下的多模态临床筛查云边协同系统
本文提出了一种用于资源受限农村环境中多模态临床筛查的云边协同架构,利用轻量级边缘模型生成结构化输出,再由云端大语言模型将其综合为临床摘要。在100个多模态病例上的评估显示,该混合系统在实现高准确率和事实依据性的同时,与纯云端基线相比,传输的数据量减少了数个数量级。