医学图像修复中的扩散模型:挑战、解决方案分类与未来方向

arXiv cs.CL 论文

摘要

对基于扩散的医学图像修复方法的系统性综述,涵盖架构、应用、数据集和评估策略,提出了分类方法并识别了挑战(如缺乏标准化基准)。

arXiv:2607.21904v1 Announce Type: cross Abstract: 图像修复旨在重建图像中缺失或损坏的区域,同时尽可能保留视觉和语义一致性。在医学成像中,由于伪影、信息缺失和病理改变可能损害诊断可靠性和下游临床应用,该任务尤为重要。近期,扩散模型因其能够生成解剖学上一致的修复结果,已成为医学图像修复中最先进的生成方法。本综述对基于扩散的医学图像修复方法进行了系统性回顾,涵盖了60项研究中报告的主要架构、应用、数据集和评估策略。此外,我们提出了一种基于扩散方法的分类法。分析显示,针对基于扩散的医学图像修复的研究兴趣迅速增长,其中去噪扩散概率模型和潜在扩散模型成为主流架构。被综述的研究主要关注伪影去除、数据增强、伪健康组织重建和异常检测,特别是在磁共振成像和计算机断层扫描成像中。总体而言,扩散模型在生成解剖学上合理的修复结果以及辅助下游临床任务方面表现出强大性能。然而,本综述也强调了重要挑战,包括缺乏标准化基准、数据集多样性有限,以及在多种临床应用和成像场景中验证程序受限。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:42

# 扩散模型在医学图像修复中的应用:挑战、解决方案分类与未来方向  
来源:https://arxiv.org/html/2607.21904  

Arthur Dantas Mangussi0000-0003-2086-532X (https://orcid.org/0000-0003-2086-532X)  
[email protected] (https://arxiv.org/html/2607.21904v1/mailto:[email protected])  
计算机科学系,航空技术学院与科学技术研究所,圣保罗联邦大学  
巴西圣若泽杜斯坎波斯  

Joana Cristo [email protected] (https://arxiv.org/html/2607.21904v1/mailto:[email protected])  
https://orcid.org/LASIGE,里斯本大学理学院  
葡萄牙里斯本  

Ricardo Cardoso Pereira  
科英布拉大学,CISUC/LASI – 科英布拉大学信息学与系统工程中心,信息工程系  
葡萄牙科英布拉  
[email protected] (https://arxiv.org/html/2607.21904v1/mailto:[email protected])  

Ana Carolina Lorena  
计算机科学系,航空技术学院与科学技术研究所,圣保罗联邦大学  
巴西圣若泽杜斯坎波斯  
[email protected] (https://arxiv.org/html/2607.21904v1/mailto:[email protected])  

Mário A. T. Figueiredo  
里斯本大学高等技术学院,电信研究所  
葡萄牙里斯本  
[email protected] (https://arxiv.org/html/2607.21904v1/mailto:[email protected])  

与  
Pedro Henriques Abreu  
科英布拉大学,CISUC/LASI – 科英布拉大学信息学与系统工程中心,信息工程系  
葡萄牙科英布拉  
[email protected] (https://arxiv.org/html/2607.21904v1/mailto:[email protected])  

(2026)  

###### 摘要. 图像修复旨在重建图像中缺失或损坏的区域,同时尽可能保持视觉和语义的一致性。在医学成像中,这一任务尤为重要,因为伪影、信息缺失以及病理改变可能损害诊断可靠性和下游临床应用。近年来,扩散模型因其能够生成解剖学上一致的重建结果,已成为医学图像修复中最先进的生成方法。本综述对基于扩散的医学图像修复方法进行了系统性回顾,涵盖了60项研究报告中的主要架构、应用、数据集和评估策略。此外,我们提出了一种基于扩散方法的分类法。分析显示,对基于扩散的医学图像修复的研究兴趣快速增长,其中去噪扩散概率模型和潜在扩散模型成为主流架构。纳入的研究主要集中在伪影去除、数据增强、伪健康组织重建和异常检测方面,尤其是在磁共振成像和计算机断层扫描成像中。总体而言,扩散模型在生成解剖学上合理的重建结果以及辅助下游临床任务方面表现出强大性能。然而,本综述也指出了重要挑战,包括缺乏标准化基准、数据集多样性有限,以及在多样化的临床应用和成像场景中验证程序受限。

扩散模型,系统性综述,图像修复,医疗保健  

††版权:acmlicensed  
††期刊年份:2026  
††CCS:通用与参考文献 综述与概览  
††CCS:计算方法 重建  

## 1. 引言  

医学成像已成为诊断、监测和治疗计划中不可或缺的工具,涵盖从通过磁共振成像(MRI)检测的神经系统疾病到通过计算机断层扫描(CT)评估的心血管疾病(Santos 等,2024 (https://arxiv.org/html/2607.21904#bib.bib2); Vavekanand 等,2026 (https://arxiv.org/html/2607.21904#bib.bib1))。尽管医学成像在现代医疗中扮演着关键角色,但它仍然面临多种挑战,这些挑战源于患者运动、设备限制、安全协议以及扫描时的时间限制等因素(Vavekanand 等,2026 (https://arxiv.org/html/2607.21904#bib.bib1))。这些因素常常导致数据不完整或缺失,这是实际临床环境中难以实现理想采集条件时的常见问题。在此背景下,缺失数据指的是图像特定区域信息的缺失,甚至整幅图像的完全丢失,这可能损害其可靠性和临床实用性(Santos 等,2025 (https://arxiv.org/html/2607.21904#bib.bib4))。这个问题尤其令人担忧,因为缺失信息可能掩盖重要的解剖细节,增加误诊或治疗延误的风险。为了解决这些情况,一种可能性是使用图像修复技术,该技术能够重建图像中缺失或损坏的区域,同时保持与周围内容的视觉和语义一致性(Santos 等,2025 (https://arxiv.org/html/2607.21904#bib.bib4))。作为图像处理和计算机视觉中的一项基本任务,图像修复已在图像恢复、物体移除和视频编辑等领域找到了应用(Quan 等,2024 (https://arxiv.org/html/2607.21904#bib.bib83))。然而,在医疗领域,挑战不仅限于视觉合理性,还需要保留临床相关且诊断准确的信息(Santos 等,2025 (https://arxiv.org/html/2607.21904#bib.bib4))。受深度学习技术最新进展的推动,图像修复因此成为一个活跃且快速发展的研究领域(Elharrouss 等,2024 (https://arxiv.org/html/2607.21904#bib.bib3))。生成对抗网络(GAN)、视觉变换器(ViT)和扩散模型(DM)等生成架构已越来越多地用于图像重建、分割和修复等任务(Wang 和 Kwak,2025 (https://arxiv.org/html/2607.21904#bib.bib61))。在这些方法中,扩散模型在修复及相关的生成任务中表现出特别强劲的性能(Wang 和 Kwak,2025 (https://arxiv.org/html/2607.21904#bib.bib61))。近年来的研究表明,扩散模型已广泛用于图像生成和编辑任务,包括图像到图像的翻译和修复(Croitoru 等,2023 (https://arxiv.org/html/2607.21904#bib.bib7))。尽管该领域发展迅速,但专门关注基于扩散的医学图像修复的综述相对较少。现有的综述主要关注扩散模型在医学成像中的广泛应用(Kazerouni 等,2023 (https://arxiv.org/html/2607.21904#bib.bib10); Azad 等,2026 (https://arxiv.org/html/2607.21904#bib.bib9))或医学图像合成(Khosravi 等,2025 (https://arxiv.org/html/2607.21904#bib.bib11)),而医学图像修复相对未得到充分探索。相比之下,本综述专门致力于基于扩散的医学图像修复,结合了文献的系统性分析与最新方法的实验评估。通过整合分散于众多出版物中的最新进展,本文确定了关键方法、趋势、挑战和未来研究机会,旨在为该领域的研究人员和实践者提供有价值的资源。总之,本文的主要贡献包括:

- - 对基于扩散的医学图像修复方法及近期研究趋势进行系统性回顾,识别出最广泛采用的架构、应用和成像模态;
- - 提出面向医学成像应用的扩散方法分类法,为现有方法提供结构化组织,促进该领域的未来研究;
- - 对数据集、评估指标和实验设置进行比较分析,旨在识别常见的评估实践,并推动更标准化评估方法的发展;
- - 通过实验案例研究评估具有代表性的最新方法,实现对基于扩散的修复方法更详细的比较。

本文的其余部分组织如下。第 2 节 (https://arxiv.org/html/2607.21904#S2) 描述了进行系统性综述所采用的方法,第 3 节 (https://arxiv.org/html/2607.21904#S3) 提供了扩散模型的概述和分类法。第 4 节 (https://arxiv.org/html/2607.21904#S4) 介绍了文献综述的主要发现和识别出的关键模式。随后,第 5 节 (https://arxiv.org/html/2607.21904#S5) 深入讨论了扩散模型在医学图像修复中的应用。第 6 节 (https://arxiv.org/html/2607.21904#S6) 引入了一个案例研究,展示了这些方法的实际应用。最后,第 7 节 (https://arxiv.org/html/2607.21904#S7) 对全文进行总结。

## 2. 方法论  

主要目标是分析扩散模型在医学图像修复中的应用最新进展。为此,我们在 Scopus、Web of Science 和 IEEE Xplore 等多个数据库中进行了系统性文献检索,使用以下关键词的组合:image inpainting、diffusion models、image completion、medical images、clinical、healthcare 和 radiology。检索范围涵盖 2023 年至 2026 年间发表的出版物,因为 DDPM 于 2020 年首次正式提出(Ho 等,2020 (https://arxiv.org/html/2607.21904#bib.bib71))。最初,共检索到 841 篇文献。本综述遵循了广泛采用的系统综述和元分析首选报告项目(PRISMA)框架(Hasan 等,2021 (https://arxiv.org/html/2607.21904#bib.bib8)),如图 1 (https://arxiv.org/html/2607.21904#S2.F1) 所示。PRISMA 提供了一套基于证据的指南,旨在提高系统综述和元分析的透明度和完整性,并广泛用于结构化文献筛选和报告(Hasan 等,2021 (https://arxiv.org/html/2607.21904#bib.bib8))。在识别阶段,移除了重复记录(n = 276),获得 565 篇文献符合筛选条件。随后,通过标题和摘要筛选来评估检索到的研究的相关性。不符合以下条件的文献被排除:非英文文献、未采用基于扩散的架构、与图像数据无关、或未涉及图像修复任务。经过初步筛选后,141 篇研究进入全文评估阶段。在合格性判定阶段,对剩余文献的全文进行了仔细评估,以确定它们与本综述核心范围(即扩散模型在医学图像修复中的应用)的一致性。以下情况的文献被排除:关注非医学成像应用的、采用扩散模型执行与修复无关任务的、或涉及相邻但不同问题(如通用图像生成(Hung 等,2023 (https://arxiv.org/html/2607.21904#bib.bib33))或缺失模态合成(Kalantar 等,2023 (https://arxiv.org/html/2607.21904#bib.bib35); Kebaili 等,2025 (https://arxiv.org/html/2607.21904#bib.bib18)))的。经过完整的 PRISMA 流程,共 60 篇文献满足所有纳入标准,最终被选入本综述。

见图注  
图 1. 所采用的用于文章检索流程的 PRISMA 方法,其中展示了文章纳入和排除标准的证据。  
PRISMA 方法  
用于文章检索的 PRISMA 方法,其中展示了文章纳入和排除标准的证据。

## 3. 扩散模型:概述与提出的分类法  

近年来,生成式人工智能(GenAI)在架构创新和计算能力提升的推动下取得了快速发展(Bengesi 等,2024 (https://arxiv.org/html/2607.21904#bib.bib84))。根据 Feuerriegel 等人(Feuerriegel 等,2024 (https://arxiv.org/html/2607.21904#bib.bib75))的观点,“生成式 AI”指的是通过学习基础数据分布来生成新的、有意义的内容(如文本、图像或音频)的计算技术。主流的模型家族包括生成对抗网络(GAN)、自动编码器(AE)、变换器和扩散模型(Sengar 等,2025 (https://arxiv.org/html/2607.21904#bib.bib76))。表 1 (https://arxiv.org/html/2607.21904#S3.T1) 总结了这些架构的主要特征。

表 1. 核心深度生成模型架构概览 (Banh 和 Strobel,2023 (https://arxiv.org/html/2607.21904#bib.bib77))。

| 架构 | 描述 |
|------|------|
| AE | 采用编码器-解码器框架将数据映射到潜在空间并重建。通过优化训练集数据似然的下界来执行学习。 |
| GAN | 由生成器和判别器组成,在对抗性设置中训练。生成器合成数据,判别器区分真实样本与生成样本,推动高质量输出的生成。 |
| 变换器 | 使用自注意力机制捕捉长程依赖关系,构成了现代大规模序列和多模态数据模型的基础。 |
| 扩散 | 定义一个前向过程,逐步添加高斯噪声经 \(T\) 步,以及一个可学习的反向过程(通常由 U-Net 参数化),通过迭代去噪训练重建原始数据。 |

如表 1 (https://arxiv.org/html/2607.21904#S3.T1) 所述,U-Net 架构已成为图像标准扩散模型的事实上的骨干网络。Ho 等人首次在此背景下引入该架构,主要由 ResNet 块组成,其间穿插了较低分辨率下的空间自注意力模块(Ho 等,2020 (https://arxiv.org/html/2607.21904#bib.bib71))。然而,最近的研究表明,U-Net 的特定归纳偏置对扩散模型的性能并非严格必要。因此,新兴架构,如扩散变换器(DiT),已成功用标准变换器块(在潜在块上操作)取代了传统的 U-Net 骨干(Peebles 和 Xie,2023 (https://arxiv.org/html/2607.21904#bib.bib96))。虽然 GAN 能够高效生成高保真样本,但它们常常面临模式覆盖有限的缺陷,并且众所周知训练困难(Xiao 等,2022 (https://arxiv.org/html/2607.21904#bib.bib85))。自动编码器,尤其是变分自动编码器(VAE),通常能实现更好的多样性,但可能生成质量较低的样本。扩散和基于变换器的模型已成为引人注目的替代方案,在样本质量和模式覆盖之间提供了有利的权衡,尽管常常以牺牲计算效率为代价。特别是,扩散模型的迭代采样过程和变换器的高计算复杂性导致了更慢的推理和更高的资源需求(Kazerouni 等,2023 (https://arxiv.org/html/2607.21904#bib.bib10))。图 2 (https://arxiv.org/html/2607.21904#S3.F2) 说明了主要生成模型家族之间的这种权衡。

见图注  
图 2. 主要生成模型家族之间在样本质量、多样性和计算效率之间的权衡。  

扩散模型最近在医学图像修复中取得了最先进的性能,尤其在...

相似文章

用于交互式放射学报告起草的离散扩散语言模型

arXiv cs.AI

本文改编了一种扩散语言模型用于交互式放射学报告起草,表明其在准确性上与自回归模型相当,同时提供独特的填充能力,使放射科医生能够修复报告片段并让模型填充它们之间的文本。