基于视觉先验的医学病灶分割特征重配置
摘要
本文提出了FreNet,一个用于医学病灶分割的基于视觉先验的特征重配置框架,通过解决背景干扰和多样化的病灶形态,在多个基准测试上显著优于现有方法。
arXiv:2609.03535v1 公告类型:新
摘要:医学图像中的病灶分割在临床诊断和治疗计划中扮演着关键角色。尽管取得了显著进展,但病灶分割仍具有挑战性,主要由于两个因素:(1)复杂的背景干扰;(2)多样化的病灶形态。现有的基于编码器-解码器的方法主要关注增强特征提取或重新设计解码策略。然而,它们在编码阶段缺乏早期先验指导和特征重配置,限制了它们在处理这些挑战时的有效性。为了解决这些局限性,我们提出了FreNet,一个基于视觉先验的特征重配置框架,它在编码前执行像素级重配置,并在编码过程中进行特征级重配置,以实现精确的医学病灶分割。为了抑制背景响应,我们提出了隐式先验神经网络(IPNN),它建模一个连续空间场,并利用来自SAM的视觉先验在编码阶段前重构输入图像。为了更好地处理多样化的病灶形态,我们设计了双域特征重配置(DFR)模块,在编码阶段逐步重构骨干网络特征。在DFR中,频率解耦模块(FDM)在频域解耦骨干网络特征以增强前景-背景可区分性,而空间定位模块(SLM)在频率解耦后空间重新定位并改善空间稳定性。在三个成像模态的9个医学图像分割基准测试上的大量实验表明,FreNet显著优于现有方法(SOTA)。在具有挑战性的ETIS数据集上,我们的方法在Dice指标上比SOTA方法提高了5.0%,比SAM提高了7.2%。
查看缓存全文
缓存时间: 2026/09/04 06:07
# 基于视觉先验的特征重配置用于医学病变分割
来源: https://arxiv.org/html/2609.03535
###### 摘要
医学图像中的病变分割在临床诊断和治疗规划中起着至关重要的作用。尽管取得了显著进展,但由于两个主要因素,病变分割仍然具有挑战性:(1) 复杂的背景干扰;(2) 多样的病变形态。现有的基于编码器-解码器的方法主要侧重于增强特征提取或重新设计解码策略。然而,它们缺乏编码阶段的早期先验引导和特征重配置,限制了其处理这些挑战的有效性。为了解决这些局限性,我们提出了 FreNet,一种具有视觉先验的特征重配置框架,它在编码前执行像素级重配置,在编码过程中执行特征级重配置,以实现精确的医学病变分割。为了抑制背景响应,我们提出了一个隐式先验神经网络(IPNN),它建模一个连续的空间场,并利用来自 SAM 的视觉先验在编码前对输入图像进行重配置。为了更好地处理多样的病变形态,我们设计了一个双域特征重配置(DFR)模块,在编码阶段逐步重配置骨干网络特征。在 DFR 内部,频率解耦模块(FDM)在频域中解耦骨干特征以增强前景-背景可区分性,而空间定位模块(SLM)在频率解耦后空间地重新定位并提高空间稳定性。在 9 个医学图像分割基准数据集(涵盖三种成像模式)上的大量实验表明,FreNet 显著优于最先进的(SOTA)方法。在具有挑战性的 ETIS 数据集上,我们的方法相比 SOTA 方法实现了 5.0% 的 Dice 提升,相比 SAM 实现了 7.2% 的提升。
同济大学计算机科学与技术学院
中国上海
通讯作者:luoye@tongji\.edu\.cn
## 引言
医学图像分割是医学图像分析中的一项基础任务,能够精确勾画解剖和病理结构。它支持疾病诊断(Shu et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib11);Lai et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib14);Zhang et al\. 2023 (https://arxiv.org/html/2609.03535#bib.bib13))、临床决策和应用。病变分割尤其关键,为疾病评估、治疗监测和预后预测提供定量信息(Hu et al\. 2021 (https://arxiv.org/html/2609.03535#bib.bib12);Tan et al\. 2026 (https://arxiv.org/html/2609.03535#bib.bib10))。
参考图 1:动机。(a) 病变分割中的两个挑战。(b) 现有方法与我们的方法之间的差异。
尽管深度学习在图像分割方面取得了显著进展,但实现稳健和精确的病变分割仍然面临两个主要因素的挑战(见图 1 (https://arxiv.org/html/2609.03535#Sx1.F1)(a))。首先,复杂的背景可能会干扰病变识别,例如皮肤镜图像中的毛发遮挡、超声图像中的斑点和伪影,以及类似于息肉的混淆结构,这些都可能诱导错误的特征响应,从而导致分割错误。其次,病变(如皮肤病变和息肉)通常表现出多样的形态,包括不规则的形状、模糊的边界以及细微的强度或纹理变化,这使得它们难以与周围组织区分,并显著增加了分割难度。为了克服这些挑战,人们从不同角度做出了大量努力。
现有方法通常分为三类(见图 1 (https://arxiv.org/html/2609.03535#Sx1.F1)(b)):多尺度方法、基于先验的方法和基于 SAM 的方法。多尺度方法增强了不同尺度(Tan et al\. 2026 (https://arxiv.org/html/2609.03535#bib.bib10);Nam et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib6))或上下文范围(Shen et al\. 2026 (https://arxiv.org/html/2609.03535#bib.bib27);Zhou et al\. 2025 (https://arxiv.org/html/2609.03535#bib.bib31);Chen et al\. 2025 (https://arxiv.org/html/2609.03535#bib.bib38))内的病变表示,但缺乏先验引导,使得背景引起的错误在网络各阶段持续存在。基于先验的方法将解剖或形状先验引入分割过程(Huang et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib22);You et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib1));然而,这些先验通常作为空间约束,然后直接输入解码器,未参与编码前的早期先验注入或编码过程中的特征重配置。基于 SAM 的方法通过微调(Zhang and Liu 2023 (https://arxiv.org/html/2609.03535#bib.bib34);Ma et al\. 2025 (https://arxiv.org/html/2609.03535#bib.bib2);Hong et al\. 2026 (https://arxiv.org/html/2609.03535#bib.bib28))、提示学习(Huang et al\. 2025 (https://arxiv.org/html/2609.03535#bib.bib26))或解码器重新设计(Cheng et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib35);Wei et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib30))将 Segment Anything Model (SAM)(Kirillov et al\. 2023 (https://arxiv.org/html/2609.03535#bib.bib4))应用于医学图像分割。这些基于 SAM 的方法同样缺乏编码前后和编码过程中的特征重配置。总体而言,现有方法要么缺乏早期先验引导,要么缺乏编码过程中的多尺度特征重配置,限制了其抑制背景和处理多样化病变形态的能力。
为了解决这些局限性,我们在编码前后引入视觉先验,使得在像素和特征级别都能进行特征重配置。我们采用 SAM 作为视觉先验来源,因其具有强大的泛化能力。通过精心设计,我们的方法对 SAM 性能的变化保持稳健,如消融研究所示。我们的框架还允许无缝替换视觉先验网络,持续提升分割性能。在编码阶段之前,我们将视觉先验注入原始图像,执行像素级重配置,使模型从一开始就聚焦于病变区域并抑制背景响应。在编码阶段,我们设计了一个空间-频率联合模块,该模块整合频域解耦和空间定位,在每一阶段逐步更新骨干网络特征,增强模型对多样化病变形态的感知能力。通过利用视觉先验在编码前后重配置特征,我们的方法为病变分割提供了一个新视角。
具体而言,我们提出了一种新颖的基于视觉先验的特征重配置框架(FreNet),该框架有效地减轻了复杂背景干扰,同时解决了病变分割中多样化的病变形态问题。首先,我们设计了一个隐式先验神经网络(IPNN),通过连续空间建模和逐像素动态权重重配置,将视觉先验注入输入图像,从而在编码前抑制背景噪声,并为后续特征提取提供一个病变感知的基础。我们提出了一个双域特征重配置(DFR)模块,用于在骨干网络的每个阶段逐步细化中间特征,并增强病变区域的可区分性。DFR 模块由频率解耦模块(FDM)和空间定位模块(SLM)组成。FDM 执行频域解耦以增强病变与背景的可分离性,而 SLM 逐像素地保持空间连续性,重新引入定位指导以缓解频率解耦引起的病变区域内激活不连续性。我们的主要贡献如下:
- • 我们提出了 FreNet,一个新颖的特征重配置框架,在编码前后引入来自 SAM 的视觉先验以重配置特征。此外,FreNet 提供了一个灵活的框架,可以容纳各种视觉先验网络以提升性能增益。
- • 我们设计了 IPNN,利用视觉先验在编码前对输入图像执行像素级重配置,有效抑制背景响应并增强病变区域激活。
- • 我们提出了 DFR 模块,通过频率解耦和空间定位,在编码过程中逐步重配置骨干网络特征,实现细粒度的前景-背景分离。
- • 在涵盖三种成像模式的 9 个基准数据集上的大量实验表明,FreNet 具有优越的分割精度和泛化能力。
## 相关工作
参考图 2:FreNet 及其 IPNN 和 DFR 模块概览。IPNN 在编码前向输入注入密集的视觉先验以进行像素级重配置。DFR 集成频率解耦和空间定位,用于编码过程中的特征级重配置。
### 病变分割中的多尺度方法
最近的病变分割方法主要建立在多尺度建模、U-Net 变体和混合架构之上。MADGNet(Nam et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib6))通过多频率注意力增强结构完整性,Zig-RiR(Chen et al\. 2025 (https://arxiv.org/html/2609.03535#bib.bib38))通过锯齿形 RWKV 扫描捕获长程依赖性,nnWNet(Zhou et al\. 2025 (https://arxiv.org/html/2609.03535#bib.bib31))整合 Transformer 和卷积进行全局-局部特征融合,Rolling-Unet(Liu et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib5))结合 CNN 和 MLP 模块来建模局部和长程上下文,Kadformer(Tan et al\. 2026 (https://arxiv.org/html/2609.03535#bib.bib10))采用 KAN 增强的注意力来加强编码器表示,AD-GBC(Shen et al\. 2026 (https://arxiv.org/html/2609.03535#bib.bib27))引入可学习的各向异性区域进行可微的几何感知特征重配置。然而,这些方法通常缺乏先验引导,使其容易受到复杂背景的干扰。
### 病变分割中的基于先验的方法
为了克服传统方法中缺乏引导的问题,一些方法探索了先验驱动的约束。CPCA(Huang et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib22))使用通道先验来调制空间注意力,从而增强特征选择性,而 SPGNet(Song et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib25))从标注掩模中学习统计形状先验以提供结构约束;PG-SAM(Zhong et al\. 2025 (https://arxiv.org/html/2609.03535#bib.bib23))利用文本信息生成先验以增强分割;基于扩散的方法(如 PGDIFFSeg(Feng et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib24)))使用生成先验逐步细化分割图,但计算成本高。总体而言,这些基于先验的方法主要依赖于后期的空间约束,缺乏编码前的先验注入和编码过程中的特征重配置,这限制了早期的背景抑制和形态感知的病变表示。
### 病变分割中的基于 SAM 的方法
基础模型 SAM(Kirillov et al\. 2023 (https://arxiv.org/html/2609.03535#bib.bib4))的出现,通过利用其强大的泛化能力和灵活的提示机制,为医学图像分割开辟了新途径。这催生了旨在临床应用的适配。SAMed(Zhang and Liu 2023 (https://arxiv.org/html/2609.03535#bib.bib34))和 SAM Adapter(Chen et al\. 2023 (https://arxiv.org/html/2609.03535#bib.bib32))分别通过基于 LoRA 的微调和轻量级适配器高效地将 SAM 适配到医学图像分割;Learnable Prompting SAM(Huang et al\. 2025 (https://arxiv.org/html/2609.03535#bib.bib26))和 Sam2Rad(Wahd et al\. 2025 (https://arxiv.org/html/2609.03535#bib.bib29))引入可学习提示以减少对人工提示的依赖;H-SAM(Cheng et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib35))采用分层解码和掩模引导注意力进行无提示医学图像分割,而 I-MedSAM(Wei et al\. 2024 (https://arxiv.org/html/2609.03535#bib.bib30))用 INR 网络替换掩模解码器,实现连续且分辨率灵活的分割。然而,这些基于 SAM 的方法缺乏多尺度特征重配置,限制了其在多样化病变形态下的感知能力。
## 方法
### 网络架构
为了解决现有模型在处理复杂背景和多样化病变形态方面的局限性,我们提出了一种新颖的 FreNet,该框架引入了来自 SAM 的视觉先验,在编码前执行像素级重配置,并在编码过程中在空间域和频率域对多尺度表示进行特征级重配置。图 2 (https://arxiv.org/html/2609.03535#Sx2.F2) 展示了 FreNet 的整体架构。在编码前,IPNN 自适应地将从 SAM 派生的密集先验注入原始输入图像 I₀,重构输入表示,以增强病变感知同时抑制背景响应。然后,这些经过先验重配置的输入 I₁ 被送入 PVTv2(Wang et al\. 2022 (https://arxiv.org/html/2609.03535#bib.bib7))骨干网络进行渐进式特征提取,产生四个中间特征(P₁–P₄)。为了精确勾画病变形态,我们在每对相邻骨干层之间设计了 DFR 模块。DFR 模块首先在频域中解缠特征,然后通过空间定位重建它们,再传递给下一个骨干阶段,从而实现细粒度的病变感知和稳健的病变-背景分离,如图 2 (https://arxiv.org/html/2609.03535#Sx2.F2) 中的 t-SNE 可视化所示。此外,采用了残差连接以保留必要的原始信息并减轻更深层中的特征退化。最后,更新后的中间特征(F₁–F₃)与 P₄ 自上而下融合并解码为最终输出 O。
### 隐式先验神经网络
为了减轻复杂背景对病变分割的干扰,我们提出了 IPNN,它在特征提取之前集成视觉先验(见图 3 (https://arxiv.org/html/2609.03535#Sx3.F3))。受基于坐标的隐式神经表示(Mildenhall et al\. 2021 (https://arxiv.org/html/2609.03535#bib.bib8))启发,IPNN 建模一个以 SAM 派生的掩模为条件的连续二维空间场,使得能够将视觉先验逐像素地注入原始图像,以在像素级别重配置输入表示。
形式化地说,给定输入图像特征 I₀∈ℝ^{C×H×W} 和来自 SAM 的先验掩模 M∈ℝ^{1×H×W},我们首先构建一个归一化的坐标网格 C∈ℝ^{H×W×2},其中每个像素位置与一个在范围 [−1,1] 内线性间隔的二维坐标 (y,x) 相关联。具体来说,水平轴和垂直轴分别被离散化为 W 个和 H 个点,形成一个密集的空间网格 Cᵢⱼ,其中 Cᵢⱼ = (yᵢ, xⱼ)。相似文章
M^{2}SNet:多尺度内多尺度减法网络用于医学图像分割
本文提出了M2SNet,一种用于医学图像分割的多尺度内多尺度减法网络。它利用减法运算捕获编码器各层之间的差异特征,提高了病灶定位的准确性和边缘的清晰度。在涵盖四种医学成像模态的十一个数据集上,该方法取得了最先进的性能。
虚拟节点引导的动态图神经网络用于缺失模态的脑肿瘤分割
本文提出了一种基于图的一阶段框架用于脑肿瘤分割,通过引入模态特定的虚拟节点和动态连接策略来处理缺失的MRI模态,在BRATS-2018和BRATS-2020数据集上优于最先进的方法。
部分信息分解作为资源受限深度神经网络训练中脑肿瘤分割的多对比3D MRI选择策略
本文提出了一种部分信息分解框架,用于选择最具信息量的MRI对比对,以使用轻量级3D U-Net进行脑肿瘤分割,在保持性能的同时降低计算成本。
men1scus/birefnet
BiRefNet 是一个在 Replicate 上提供的图像分割 AI 模型,可在 Nvidia A100 GPU 上提供经济高效的推理,并且是开源的。
背景也重要:用可迁移攻击攻破医学视觉语言模型
MedFocusLeak 首次提出针对医学视觉语言模型的可迁移黑盒对抗攻击,通过不可察觉的背景扰动在六种成像模态上误导临床诊断。