扩散模型作为通用分割学习器
摘要
本文介绍了 DiGSeg 框架,该框架利用潜在空间条件控制和文本引导对齐,将预训练的扩散模型重新用于实现最先进的语义分割和开放词汇分割。
查看缓存全文
缓存时间: 2026/05/08 08:03
论文页面 - Diffusion Model as a Generalist Segmentation Learner
来源: https://huggingface.co/papers/2604.24575
摘要
预训练的扩散模型可以通过潜在空间条件控制和文本引导对齐,适应语义和开放词汇分割任务,并在多个领域实现最先进的性能。
扩散模型 (https://huggingface.co/papers?q=Diffusion%20models) 主要用于图像合成训练,但其去噪轨迹编码了丰富的、空间对齐的视觉先验知识 (https://huggingface.co/papers?q=visual%20priors)。在本文中,我们证明了这些先验知识可以被利用来进行文本条件的语义和开放词汇分割 (https://huggingface.co/papers?q=open-vocabulary%20segmentation),并且这种方法可以泛化到各种下游任务中,形成一个通用的扩散分割框架。具体而言,我们提出了 DiGSeg(Diffusion Models as a Generalist Segmentation Learner),将预训练的扩散模型重新利用为一个统一的分割框架。我们的方法将输入图像和真实掩码编码到潜在空间 (https://huggingface.co/papers?q=latent%20space),并将它们作为条件信号连接起来,用于扩散 U-Net (https://huggingface.co/papers?q=diffusion%20U-Net)。一个并行的 CLIP 对齐文本路径 (https://huggingface.co/papers?q=CLIP-aligned%20text%20pathway) 在多尺度上注入语言特征,使模型能够将对齐的文本查询与不断演化的视觉表示相匹配。这种设计将现成的扩散主干转换成一个通用接口,产生基于外观和任意文本提示的结构化分割掩码。大量的实验表明,该方法在标准语义分割 (https://huggingface.co/papers?q=semantic%20segmentation) 基准上取得了最先进的性能,并且在开放词汇泛化以及跨领域迁移(医疗、遥感和农业场景)方面表现出色,而无需特定领域的架构定制。这些结果表明,现代扩散主干可以作为通用分割学习者,而不仅仅是生成器,从而缩小了视觉生成与视觉理解 (https://huggingface.co/papers?q=visual%20understanding) 之间的差距。
查看 arXiv 页面 (https://arxiv.org/abs/2604.24575) 查看 PDF (https://arxiv.org/pdf/2604.24575) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2604.24575)
在你的代理中获取此论文:
hf papers read 2604.24575
没有最新的 CLI? curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有链接此论文的模型
在模型的 README.md 中引用 arxiv.org/abs/2604.24575 以从该页面链接。
引用此论文的数据集 0
没有链接此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2604.24575 以从该页面链接。
引用此论文的空间 0
没有链接此论文的空间
在空间的 README.md 中引用 arxiv.org/abs/2604.24575 以从该页面链接。
包含此论文的合集 0
没有包含此论文的合集
将此论文添加到合集 (https://huggingface.co/new-collection) 以从该页面链接。
相似文章
扩散应进入语言模型的何处?几何引导的隐藏状态替换
本文提出DiHAL,一种扩散-变换器混合模型,利用基于几何的代理选择预训练语言模型中的某个层,通过扩散桥进行隐藏状态替换,通过避免直接的词元恢复来改进连续扩散语言建模。
Semantic DLM+:通过转移核设计中的偏差-方差权衡改进扩散语言模型
本文从偏差-方差角度对扩散语言模型进行了理论分析,识别了掩码扩散与均匀扩散核之间的权衡。提出了SemDLM+,通过添加全局转移和语义频率惩罚来克服语义盆地问题,在LM1B和OpenWebText基准上实现了有竞争力的生成质量。
GDSD:强化学习作为扩散语言模型的引导式降噪器自蒸馏
GDSD提出了一种强化学习方法,直接从优势引导的自教师中蒸馏扩散语言模型的降噪器,避免了基于ELBO的似然代理带来的偏差。在规划、数学和编码基准上,比先前最先进的方法准确率提升高达+19.6%。
扩散语言模型的动态分块
本文介绍了扩散语言模型的动态分块(DCDM),该方法使用可微分的Chunking Attention机制,用内容定义的语义块替换块离散扩散中的固定位置块,在高达1.5B参数规模上实现了一致的改进。
通过自动分割和块蒸馏实现块注意力泛化
本文介绍了SemanticSeg,一个用于长文本语义分割的大规模数据集,以及块蒸馏(block distillation)训练框架,该框架使块注意力模型能够接近全注意力性能,从而在RAG和长上下文场景中改善KV缓存复用。