CONFLUX:一种用于3D胸部CT合成的潜在扩散模型,采用强化学习后训练

Hugging Face Daily Papers 论文

摘要

CONFLUX是一种用于胸部CT合成的3D潜在扩散模型,能够实现高保真的体积生成,并具有可控的临床属性。通过强化学习后训练阶段增强了条件生成的可靠性。该模型及一个包含约20万胸部CT体积的合成数据集已发布。

可控的3D医学图像生成模型可以合成具有指定临床属性的体积,但这要求生成的样本同时具备高保真度、原生3D特性,并忠实于所请求的条件。我们提出了CONFLUX,一种用于胸部计算机断层扫描(CT)的潜在扩散模型:一个3D变分自编码器压缩每个体积,一个修正流变换器在潜在空间中生成图像。生成过程通过自适应层归一化,以结构化的放射学元数据(18种异常发现、性别、年龄和重建核)为条件。该模型在三平面Frechet距离(FID 32.3,MAISI为74.6)上显著优于体积基线,同时提供对临床属性的直接控制。为了加强这种控制,我们增加了一个在线强化学习后训练阶段(组相对策略优化),该阶段奖励分类器从每个生成体积中可靠地恢复所请求的发现。通过一个独立的分类器评估,后训练消除了相对于真实扫描可靠性47%的差距。我们发布了该模型以及一个包含约20万合成胸部CT体积的数据集,该数据集包含涵盖多种临床发现的条件元数据。
查看原文
查看缓存全文

缓存时间: 2026/07/07 10:43

论文页面 - CONFLUX: A Latent Diusion Model for 3D Chest-CT Synthesis with RL Post-Training

来源: https://huggingface.co/papers/2607.02998

摘要

一种用于胸部CT生成的3D潜在扩散模型,能够生成高保真结果,同时通过元数据条件和强化学习优化实现对临床属性的控制。

可控的3D医学图像生成模型可以合成具有指定临床属性(https://huggingface.co/papers?q=clinical%20attributes)的体积,但这要求样本同时具备高保真(https://huggingface.co/papers?q=fid)度、原生3D、且与请求条件保持一致。我们提出了CONFLUX,一种潜在扩散模型(https://huggingface.co/papers?q=latent%20diffusion%20model)用于胸部计算机断层扫描(https://huggingface.co/papers?q=chest%20computed%20tomography)(CT):一个3D变分自编码器(https://huggingface.co/papers?q=3D%20variational%20autoencoder)压缩每个体积,然后一个整流流变压器(https://huggingface.co/papers?q=rectified-flow%20transformer)在潜在空间中生成。生成过程通过自适应层归一化(https://huggingface.co/papers?q=adaptive%20layer%20normalization)条件于结构化放射学元数据(https://huggingface.co/papers?q=radiological%20metadata)(18种异常发现、性别、年龄和重建核)。该模型在三平面Fréchet距离(https://huggingface.co/papers?q=tri-planar%20Frechet%20distance)(FID(https://huggingface.co/papers?q=FID)32.3对比MAISI的74.6)上领先于强体积基线,同时提供对临床属性(https://huggingface.co/papers?q=clinical%20attributes)的直接控制。为了加强这种控制,我们增加了一个在线强化学习后训练(https://huggingface.co/papers?q=reinforcement-learning%20post-training)阶段(组相对策略优化(https://huggingface.co/papers?q=group-relative%20policy%20optimization)),该阶段奖励分类器从每个生成体积中可靠地恢复所请求的发现。通过一个独立分类器的评估,后训练消除了相对于真实扫描可靠性的47%的差距。我们发布了该模型和一个约20万例合成胸部CT数据集,其条件元数据涵盖了广泛的临床发现。

查看arXiv页面(https://arxiv.org/abs/2607.02998)查看PDF(https://arxiv.org/pdf/2607.02998)项目页面(https://huggingface.co/spaces/mxvp/conflux-chest-ct-demo)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.02998)

在你的代理中获取这篇论文:

hf papers read 2607.02998

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型1

gevaertlab/conflux 无条件图像生成• 更新于大约4小时前 • 9 (https://huggingface.co/gevaertlab/conflux)

引用此论文的数据集1

gevaertlab/conflux-chest-ct 查看器• 更新于大约4小时前 • 200k • 41 • 1 (https://huggingface.co/datasets/gevaertlab/conflux-chest-ct)

引用此论文的Spaces1

包含此论文的收藏0

没有包含此论文的收藏

将这篇论文添加到收藏(https://huggingface.co/new-collection)以便从此页面链接。

相似文章

FLUX3D: 基于扩散对齐稀疏表示的高保真3D高斯生成

Hugging Face Daily Papers

FLUX3D引入了一个框架,通过利用扩散对齐的结构化潜变量和稀疏结构感知的扩散变压器来增强表示学习和跨模态对齐,实现高保真图像到3D高斯泼溅生成,取得了最先进的结果。

AsymFlow宣称通过超越潜在扩散,生成更逼真的AI图像

Reddit r/ArtificialInteligence

AsymFlow是斯坦福大学提出的一种新方法,它将潜在扩散模型转换为像素空间,通过避免压缩带来的信息损失,生成更逼真的图像。在基准测试中,它以更低的计算成本超越了FLUX.2 klein。

Surflo:具有全局状态的一致3D表面流模型

Hugging Face Daily Papers

Surflo是一种前馈3D重建模型,它将未定姿的RGB视图压缩成潜在标记,并通过流匹配解码出一致的3D表面点,支持可变分辨率输出,在速度上优于现有方法。

重新审视用于3D CT报告生成的LLM适配:规模与诊断先验研究

arXiv cs.CL

本文研究了将大语言模型适配到3D CT报告生成的参数高效策略,提出了RAD3D-Prefix,一个轻量级的诊断先验条件框架,该框架保持LLM冻结,仅需极少的可训练参数。结果表明,冻结更大的LLM(约10亿参数以上)并仅训练轻量级投影层,能够在性能、泛化能力和计算效率之间实现更优的权衡。