通过概念扩展和密集监督释放图像编辑潜力

Hugging Face Daily Papers 论文

摘要

本文提出了一种针对扩散模型图像编辑的层次化分类法和密集监督训练策略,利用包含1200万编辑对的大型数据集和细粒度评估基准来提升模型性能。

现有的图像编辑框架主要遵循文本到图像扩散模型的训练范式。然而,将此范式扩展到图像编辑凸显了两个内在差异,具体而言,即对编辑概念粒度的关注不足以及由稀疏监督信号导致的训练效率低下。为解决这些问题,我们建立了一个全面的层次化分类法,包含超过1000个细粒度编辑概念,并通过改进的合成框架构建了ConceptEdit-12M,这是一个包含1200万高质量编辑对的大规模数据集。这种库驱动的方法有效纠正了生成数据的分布坍塌,同时确保了高数据保真度。此外,我们提出了一种密集监督训练策略,将多个非干扰概念合成到单个图像对中。通过提供更丰富的学习信号,该策略显著提升了训练效率和整体模型性能。训练结果验证了我们的策略,显著超越了先前的工作。最后,我们介绍了ConceptEdit-Bench,这是一个细粒度评估套件,旨在诊断模型在各种现实场景中的能力。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:33

论文页面 - 通过概念缩放与密集监督释放图像编辑潜力

来源:https://huggingface.co/papers/2608.16812

摘要

通过细粒度概念、大规模配对数据与精细化评估,层级分类体系与密集监督策略可提升基于扩散的图像编辑效果。

现有图像编辑框架大多遵循文本到图像扩散模型(https://huggingface.co/papers?q=text-to-image%20diffusion%20models)的训练范式。然而将该范式拓展至图像编辑领域时,暴露出两个固有差异:一是对编辑概念粒度(https://huggingface.co/papers?q=edit%20concept%20granularity)关注不足,二是稀疏监督信号(https://huggingface.co/papers?q=sparse%20supervision%20signals)导致的训练效率低下。为解决这些问题,我们构建了包含1000余细粒度编辑概念的全面层级分类体系(https://huggingface.co/papers?q=hierarchical%20taxonomy),并通过改进的合成框架创建了包含1200万组高质量编辑对的海量数据集ConceptEdit-12M(https://huggingface.co/papers?q=ConceptEdit-12M)。这种库驱动方法有效纠正了生成数据的分布坍缩问题,同时确保高数据保真度。此外,我们提出密集监督训练策略(https://huggingface.co/papers?q=dense%20supervision%20training%20strategy),可将多个互不干扰的概念(https://huggingface.co/papers?q=non-interfering%20concepts)合成为单个图像对。该策略通过提供更丰富的学习信号,显著提升了训练效率与整体模型性能。训练结果验证了我们策略的有效性,性能显著优于现有研究。最后,我们推出ConceptEdit-Bench(https://huggingface.co/papers?q=ConceptEdit-Bench)——一套精细化评估体系,可用于诊断模型在大量真实场景中的能力表现。

查看arXiv页面 (https://arxiv.org/abs/2608.16812) 查看PDF (https://arxiv.org/pdf/2608.16812) GitHub5 (https://github.com/inclusionAI/ConceptEdit) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16812)

在您的智能助手中获取本文:

hf papers read 2608\.16812

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无关联模型

在模型README.md中引用arxiv.org/abs/2608.16812,即可从本页面建立链接。

引用本文的数据集2

inclusionAI/ConceptEdit-12M 约3小时前更新 • 178 • 2 (https://huggingface.co/datasets/inclusionAI/ConceptEdit-12M)

inclusionAI/ConceptEdit-Bench 预览• 约20小时前更新 • 1 (https://huggingface.co/datasets/inclusionAI/ConceptEdit-Bench)

引用本文的Space0

无关联Space

在Space README.md中引用arxiv.org/abs/2608.16812,即可从本页面建立链接。

包含本文的合集0

无包含本文的合集

将本文添加至合集 (https://huggingface.co/new-collection) 即可从本页面建立链接。

相似文章

Abra:扩散图像训练的缩放研究

Hugging Face Daily Papers

本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。