扩散模型作为通用分割学习器

Hugging Face Daily Papers 论文

摘要

本文介绍了 DiGSeg 框架,该框架利用潜在空间条件控制和文本引导对齐,将预训练的扩散模型重新用于实现最先进的语义分割和开放词汇分割。

扩散模型主要接受图像合成训练,但其去噪轨迹编码了丰富的、空间对齐的视觉先验信息。在本文中,我们证明这些先验信息可用于文本条件的语义分割和开放词汇分割,并且该方法可泛化到各种下游任务,从而构建一个通用的扩散分割框架。具体而言,我们提出了 DiGSeg(作为通用分割学习器的扩散模型),它将预训练的扩散模型重新利用为一个统一的分割框架。我们的方法将输入图像和真实标签掩码编码到潜在空间中,并将它们拼接起来作为扩散 U-Net 的条件信号。一条平行的与 CLIP 对齐的文本路径在多个尺度上注入语言特征,使模型能够将文本查询与不断演变的视觉表示对齐。这种设计将现成的扩散骨干网络转变为一种通用接口,在外观和任意文本提示的条件约束下生成结构化的分割掩码。大量的实验表明,该方法在标准语义分割基准上达到了最先进的性能,同时在医疗、遥感和农业场景中也展现出强大的开放词汇泛化能力和跨域迁移能力——且无需针对特定领域进行架构定制。这些结果表明,现代扩散骨干网络可以作为通用分割学习器,而不仅仅是纯生成器,从而缩小了视觉生成与视觉理解之间的差距。
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:03

论文页面 - Diffusion Model as a Generalist Segmentation Learner

来源: https://huggingface.co/papers/2604.24575

摘要

预训练的扩散模型可以通过潜在空间条件控制和文本引导对齐,适应语义和开放词汇分割任务,并在多个领域实现最先进的性能。

扩散模型 (https://huggingface.co/papers?q=Diffusion%20models) 主要用于图像合成训练,但其去噪轨迹编码了丰富的、空间对齐的视觉先验知识 (https://huggingface.co/papers?q=visual%20priors)。在本文中,我们证明了这些先验知识可以被利用来进行文本条件的语义和开放词汇分割 (https://huggingface.co/papers?q=open-vocabulary%20segmentation),并且这种方法可以泛化到各种下游任务中,形成一个通用的扩散分割框架。具体而言,我们提出了 DiGSeg(Diffusion Models as a Generalist Segmentation Learner),将预训练的扩散模型重新利用为一个统一的分割框架。我们的方法将输入图像和真实掩码编码到潜在空间 (https://huggingface.co/papers?q=latent%20space),并将它们作为条件信号连接起来,用于扩散 U-Net (https://huggingface.co/papers?q=diffusion%20U-Net)。一个并行的 CLIP 对齐文本路径 (https://huggingface.co/papers?q=CLIP-aligned%20text%20pathway) 在多尺度上注入语言特征,使模型能够将对齐的文本查询与不断演化的视觉表示相匹配。这种设计将现成的扩散主干转换成一个通用接口,产生基于外观和任意文本提示的结构化分割掩码。大量的实验表明,该方法在标准语义分割 (https://huggingface.co/papers?q=semantic%20segmentation) 基准上取得了最先进的性能,并且在开放词汇泛化以及跨领域迁移(医疗、遥感和农业场景)方面表现出色,而无需特定领域的架构定制。这些结果表明,现代扩散主干可以作为通用分割学习者,而不仅仅是生成器,从而缩小了视觉生成与视觉理解 (https://huggingface.co/papers?q=visual%20understanding) 之间的差距。

查看 arXiv 页面 (https://arxiv.org/abs/2604.24575) 查看 PDF (https://arxiv.org/pdf/2604.24575) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2604.24575)

在你的代理中获取此论文:

hf papers read 2604.24575

没有最新的 CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有链接此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2604.24575 以从该页面链接。

引用此论文的数据集 0

没有链接此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2604.24575 以从该页面链接。

引用此论文的空间 0

没有链接此论文的空间

在空间的 README.md 中引用 arxiv.org/abs/2604.24575 以从该页面链接。

包含此论文的合集 0

没有包含此论文的合集

将此论文添加到合集 (https://huggingface.co/new-collection) 以从该页面链接。

相似文章

GDSD:强化学习作为扩散语言模型的引导式降噪器自蒸馏

Hugging Face Daily Papers

GDSD提出了一种强化学习方法,直接从优势引导的自教师中蒸馏扩散语言模型的降噪器,避免了基于ELBO的似然代理带来的偏差。在规划、数学和编码基准上,比先前最先进的方法准确率提升高达+19.6%。

扩散语言模型的动态分块

arXiv cs.CL

本文介绍了扩散语言模型的动态分块(DCDM),该方法使用可微分的Chunking Attention机制,用内容定义的语义块替换块离散扩散中的固定位置块,在高达1.5B参数规模上实现了一致的改进。

通过自动分割和块蒸馏实现块注意力泛化

arXiv cs.CL

本文介绍了SemanticSeg,一个用于长文本语义分割的大规模数据集,以及块蒸馏(block distillation)训练框架,该框架使块注意力模型能够接近全注意力性能,从而在RAG和长上下文场景中改善KV缓存复用。