QFedPolyp:一种通信与推理高效的联邦学习框架用于息肉分割

arXiv cs.LG 论文

摘要

QFedPolyp 提出了一种用于息肉分割的联邦学习框架,该框架利用量化感知训练来降低通信成本并实现更快的推理,同时保护隐私。

arXiv:2607.22743v1 公告类型:新 摘要:背景与目标:自动息肉分割支持计算机辅助诊断和早期结直肠癌检测。集中式深度学习要求医院共享敏感医疗数据,而联邦学习在保护隐私的同时,通过反复传输全精度模型参数引入了高通信成本。我们提出 QFedPolyp,一种用于协作息肉分割的通信与推理高效的联邦学习框架。 方法:QFedPolyp 将量化感知训练与低精度模型通信相结合。每家医院在私有数据上本地训练轻量级 U-Net,同时在训练过程中模拟量化。客户端将量化后的模型参数传输到中央服务器,在服务器上使用联邦平均进行重建和聚合。评估在 Kvasir-SEG、CVC-ClinicVideoDB、PolypGen 和 BKAI-IGH NeoPolyp 上进行。 结果:全精度联邦训练在 Kvasir-SEG 上达到 Dice 分数 0.910,在 CVC-ClinicVideoDB 上达到 0.930。均匀 8 位通信将传输成本降低约 4 倍,同时保持竞争性的分割精度。量化模型比全精度模型推理速度快达 1.5 倍。 结论:QFedPolyp 实现了隐私保护的协作息肉分割,同时降低了通信开销并加快了推理速度。生成的轻量级模型适用于实时临床部署。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:21

# QFedPolyp:一种面向息肉分割的通信与推理高效联邦学习框架
来源:https://arxiv.org/html/2607.22743

###### 摘要

背景与目标:自动息肉分割支持计算机辅助诊断和早期结直肠癌检测。集中式深度学习要求医院共享敏感医疗数据,而联邦学习虽能保护隐私,却因重复传输全精度模型参数而引入高通信成本。我们提出 QFedPolyp,一种面向协作息肉分割的通信与推理高效联邦学习框架。

方法:QFedPolyp 将量化感知训练与低精度模型通信相结合。每家医院在私有数据上本地训练轻量级 U-Net,同时在训练过程中模拟量化。客户端将量化后的模型参数传输至中央服务器,服务器使用联邦平均算法进行重建与聚合。在 Kvasir-SEG、CVC-ClinicVideoDB、PolypGen 和 BKAI-IGH NeoPolyp 四个数据集上进行评估。

结果:全精度联邦训练在 Kvasir-SEG 上 Dice 得分为 0.910,在 CVC-ClinicVideoDB 上为 0.930。均匀 8 比特通信将传输成本降低约 4×4×,同时保持有竞争力的分割精度。量化模型相比全精度模型推理速度提升高达 1.5×1.5×。

结论:QFedPolyp 实现了隐私保护的协作息肉分割,降低了通信开销并加快了推理速度。生成的轻量级模型适用于实时临床部署。

###### 关键词:

联邦学习,息肉分割,量化,隐私保护,通信效率,U-Net

††期刊:计算机方法与生物医学程序

\affiliation

organization=计算机科学与工程系,institution=密西西比州立大学,city=斯塔克维尔,state=密西西比州,country=美国

## 1 引言

结直肠癌是全球最常见且危及生命的胃肠道疾病之一。据美国国家癌症研究所统计,结直肠癌在全球癌症相关死亡中占相当大比例,而早期检测对提高患者生存率至关重要[23 (https://arxiv.org/html/2607.22743#bib.bib21)]。结肠镜检查是识别结直肠息肉的主要临床手段,息肉是异常组织增生,若不处理可能演变为恶性肿瘤。然而,手动检查结肠镜视频既耗时又易出错,尤其对于微小或视觉上不明显的病灶。因此,基于深度学习的计算机辅助诊断(CAD)系统在辅助临床医生自动检测和分割息肉方面受到广泛关注。

深度卷积神经网络在医学图像分割任务中已展现出强劲性能。在这些架构中,U-Net 因其编码器-解码器结构和

参见图注图 1:集中式训练与所提出的 QFedPolyp 框架对比。医院使用轻量级 U-Net 进行量化感知本地训练,并将量化后的更新发送至联邦学习服务器,在保护隐私的同时降低通信成本并实现高效推理。跳连结构能够有效捕获上下文和空间信息,成为最广泛使用的模型之一[27 (https://arxiv.org/html/2607.22743#bib.bib5)]。已有多种改进架构专门针对息肉分割提出。例如,PraNet 引入反向注意力机制以细化分割边界[9 (https://arxiv.org/html/2607.22743#bib.bib7)],而 HarDNet-MSEG 则专注于轻量模型设计以实现高效的实时分割[11 (https://arxiv.org/html/2607.22743#bib.bib47)]。这些模型在 Kvasir-SEG、CVC-ClinicVideoDB、PolypGen 和 BKAI-IGH NeoPolyp 等基准数据集上取得了优异结果。

尽管取得了这些进展,大多数深度学习方法仍依赖集中式训练,即多家医院的数据需收集并存储于单一位置。然而,在实际医疗环境中,由于严格的隐私法规、机构政策以及与患者数据共享相关的伦理问题,这种集中式数据聚合往往不可行。医院通常无法或不愿跨机构边界传输敏感医学图像,这限制了可供深度学习模型训练的大型多机构数据集的可用性。

联邦学习(FL)作为一种在保护数据隐私的同时实现协作模型训练的新兴范式而出现。联邦学习不传输原始数据,而是允许多个机构在本地存储数据的前提下训练共享的全局模型[21 (https://arxiv.org/html/2607.22743#bib.bib53)]。在该框架中,每个参与客户端在其私有数据集上进行本地优化,并将模型更新发送至中央服务器。服务器聚合这些更新以改进全局模型。这种去中心化学习范式使得医院之间无需违反数据保护约束即可实现协作知识共享。

尽管联邦学习有效解决了集中式训练相关的隐私问题,但它引入了与通信效率相关的新挑战。联邦学习需要客户端与中央服务器之间在多个通信轮次中反复交换模型参数。现代深度神经网络通常包含数百万个参数,传输全精度模型更新会带来沉重的通信开销,尤其是在机构网络带宽有限的情况下[18 (https://arxiv.org/html/2607.22743#bib.bib54),6 (https://arxiv.org/html/2607.22743#bib.bib20)]。因此,通信成本成为大规模联邦学习系统中的关键瓶颈。

已有多种技术被提出以提高联邦学习的通信效率,包括梯度稀疏化、模型压缩、周期平均化和参数量化[24 (https://arxiv.org/html/2607.22743#bib.bib9)]。在这些方法中,量化尤为有效,因为它直接减少了表示模型参数所需的比特数。通过传输低精度参数而非全精度浮点数值,客户端与服务器之间的通信成本可显著降低。

然而,简单的训练后量化可能会引入量化噪声,从而对模型精度产生负面影响。量化感知训练(QAT)通过在训练过程中融入模拟量化操作来克服这一局限性[13 (https://arxiv.org/html/2607.22743#bib.bib24)]。在 QAT 中,神经网络学习在低精度表示下仍保持鲁棒的参数分布,使得即使权重使用降低的数值精度表示,模型也能维持强劲性能。

图 1 (https://arxiv.org/html/2607.22743#S1.F1) 展示了集中式训练与所提出的联邦学习框架之间的概念差异。在集中式系统中,医院必须将原始医学图像传输至中央服务器,这会带来隐私风险和数据传输挑战。相比之下,所提出的方法使每家医院能够使用轻量级 U-Net 模型进行量化感知本地训练,并仅将量化后的模型更新发送至联邦服务器。这种设计保护了患者隐私,降低了通信开销,并生成了适用于实时临床部署的高效模型。

受上述挑战的驱动,本文提出 QFedPolyp,一种面向协作息肉分割的通信与推理高效联邦学习框架。QFedPolyp 将量化感知训练与量化模型参数传输相结合,以实现带宽高效的联邦优化,同时保持高分割精度。

本研究的主要贡献总结如下:

- 1. 我们提出 QFedPolyp,一种隐私保护的联邦学习框架,能够在多家医院之间实现协作息肉分割,而无需共享原始医学图像。
- 2. 我们将量化感知训练集成到联邦学习流程中,以提高分布式训练中对量化噪声的鲁棒性。
- 3. 我们通过传输量化模型更新引入通信高效的参数交换,显著降低联邦学习中的带宽需求。
- 4. 我们证明生成的低精度模型可实现更快的推理速度,使该框架适用于实时临床应用。

本文其余部分组织如下:第 2 节 (https://arxiv.org/html/2607.22743#S2) 回顾了息肉分割深度学习方法、医学影像中的联邦学习、通信高效联邦学习以及量化感知训练的相关研究。第 3 节 (https://arxiv.org/html/2607.22743#S3) 介绍 QFedPolyp,包括其联邦优化策略、轻量级 U-Net 架构、量化感知训练和量化模型通信。第 4 节 (https://arxiv.org/html/2607.22743#S4) 描述实验设置、数据集、评估指标和性能评估,包括与最新方法的详细比较。最后,第 5 节 (https://arxiv.org/html/2607.22743#S5) 总结本文并讨论未来潜在的研究方向。

## 2 相关工作

早期的深度学习方法极大地推动了自动化息肉分割的发展。2015 年首次提出的 U-Net 架构[26 (https://arxiv.org/html/2607.22743#bib.bib28)] 凭借其编码器-解码器设计和跳连结构,成为生物医学图像分割的开创性模型。在 U-Net 基础上,研究者提出了多种改进。例如,UNet++[34 (https://arxiv.org/html/2607.22743#bib.bib29)] 融入了嵌套密集跳连路径以更好地融合多尺度特征,从而获得更精确的分割结果。近期,研究人员针对结肠镜息肉分割设计了专门的 CNN 架构。ResUNet++[14 (https://arxiv.org/html/2607.22743#bib.bib31)] 使用残差块增强 U-Net 骨干,并应用后处理(条件随机场和测试时增强)显著提升了息肉数据集上的性能。Fang 等人[10 (https://arxiv.org/html/2607.22743#bib.bib30)] 提出了一种带有双解码器分支的选择性特征聚合(SFA)网络,共同细化息肉区域和边界,通过区域-边界一致性约束改善边缘定位。Fan 等人 [8 (https://arxiv.org/html/2607.22743#bib.bib32)] 提出的 PraNet 模型引入了并行反向注意力机制,迭代地突出显示息肉区域和边界线索,在多个基准数据集上达到了最先进的精度。另一种值得注意的方法是 ACSNet[33 (https://arxiv.org/html/2607.22743#bib.bib33)],它根据息肉大小自适应选择全局或局部上下文特征,使网络能够处理息肉形状的巨大变异性。所有这些先进的深度学习模型都显著提高了息肉分割的准确性。然而,它们通常假设在集中式数据集上训练,这在医学影像中由于隐私和数据共享限制而往往不可行。

联邦学习(FL)已成为一种在不损害患者隐私的前提下对分散医疗数据进行模型训练的解决方案。Sheller 等人 [28 (https://arxiv.org/html/2607.22743#bib.bib34)] 首次展示了用于 3D 医学图像分割的多机构 FL 实现,表明联邦模型可以达到与集中训练模型相近的准确度,同时每家医院将数据保留在本地。后续研究强调了 FL 在各种医学影像任务中的前景。Rieke 等人 [25 (https://arxiv.org/html/2607.22743#bib.bib35)] 概述了 FL 如何促进数字健康领域的大规模合作,强调其在克服医学数据孤岛和机构偏差方面的潜力。他们还讨论了数据异质性(例如不同站点间的成像协议差异)以及对鲁棒聚合技术的需求等挑战。Kaissis 等人 [17 (https://arxiv.org/html/2607.22743#bib.bib36)] 进一步调查了放射学中的隐私保护机器学习,包括 FL 与安全聚合、差分隐私等技术相结合以保护敏感信息。这些研究强调 FL 非常适用于数据丰富但分散的医学影像。在内窥镜和息肉分割的背景下,FL 可以使模型在不共享患者数据的情况下,从多个诊所或医院的结肠镜图像中学习。虽然 FL 已应用于 MRI、CT 和数字病理学等领域,但在结肠镜图像分割中的使用仍相对初期。我们的工作通过利用 FL 进行息肉分割来填补这一空白,确保知识在机构间共享而不交换原始视频帧或图像。

联邦学习中的一个关键挑战是客户端与服务器之间交换模型更新的通信开销。标准的 FedAvg 算法[22 (https://arxiv.org/html/2607.22743#bib.bib37)] 通过在平均模型之前执行多个本地训练轮次来降低通信频率,然而当模型较大时,传输全精度神经网络权重仍然可能消耗大量带宽。为解决此问题,已提出了多种通信高效的 FL 技术。其中一种方法是模型更新量化:例如,TernGrad[31 (https://arxiv.org/html/2607.22743#bib.bib38)] 将梯度压缩为三级三值,QSGD[2 (https://arxiv.org/html/2607.22743#bib.bib39)] 随机量化梯度并带有可证明的误差界,两者都实现了显著的带宽节省。类似地,signSGD[3 (https://arxiv.org/html/2607.22743#bib.bib40)] 只发送每个梯度的符号(每值 1 比特),大幅降低通信成本,但代价是增加方差,可通过误差反馈缓解。另一种策略是更新稀疏化或剪枝:客户端不发送所有梯度,而是仅传输最大的 kk 个梯度或超过阈值的那些梯度[19 (https://arxiv.org/html/2607.22743#bib.bib41)],并将剩余部分在本地累积。这种梯度稀疏化可以将传输数据量减少几个数量级(例如 100× 压缩),同时通过动量校正等技术保持模型性能。这些通信高效的方法通常与 FL 互补,并已集成到联邦框架中,以实现扩展到多个客户端或在带宽受限环境中的应用。在我们的工作中,我们基于这些思路,采用模型量化来降低每一轮的通信成本,这在将联邦分割部署到边缘设备或带宽受限的诊所间环境中尤为重要。

量化感知训练(QAT)是一种确保神经网络在权重和激活值降低精度(通常用于边缘硬件上的高效推理)时仍保持准确性的技术。与其在训练后对已

相似文章

FedQHD:闭式函数空间联邦强化学习

arXiv cs.LG

本文提出FedQHD,一种新颖的联邦Q学习方法,使用超维随机特征状态编码器和线性读出器实现闭式函数空间聚合,解决了异构客户端编码器导致的联邦差距。

联邦学习

ML at Berkeley

本文解释了联邦学习作为一种保护隐私的机器学习技术的概念,该技术通过在本地设备而非中央服务器上训练模型来实现。文章详细描述了加密参数更新和聚合的过程,旨在降低数据泄露风险,同时保持模型性能。

FedOPAL: 基于解析视觉提示调整的单次联邦学习

arXiv cs.AI

FedOPAL 提出了一种框架,将视觉提示适配为特征校正器,用于单次联邦学习,通过解析方法实现高效的无梯度聚合,在零服务器端训练成本下,性能显著优于现有解析方法,并可与迭代方法相媲美。