通过概念扩展和密集监督释放图像编辑潜力
摘要
本文提出了一种针对扩散模型图像编辑的层次化分类法和密集监督训练策略,利用包含1200万编辑对的大型数据集和细粒度评估基准来提升模型性能。
查看缓存全文
缓存时间: 2026/08/25 04:33
论文页面 - 通过概念缩放与密集监督释放图像编辑潜力
来源:https://huggingface.co/papers/2608.16812
摘要
通过细粒度概念、大规模配对数据与精细化评估,层级分类体系与密集监督策略可提升基于扩散的图像编辑效果。
现有图像编辑框架大多遵循文本到图像扩散模型(https://huggingface.co/papers?q=text-to-image%20diffusion%20models)的训练范式。然而将该范式拓展至图像编辑领域时,暴露出两个固有差异:一是对编辑概念粒度(https://huggingface.co/papers?q=edit%20concept%20granularity)关注不足,二是稀疏监督信号(https://huggingface.co/papers?q=sparse%20supervision%20signals)导致的训练效率低下。为解决这些问题,我们构建了包含1000余细粒度编辑概念的全面层级分类体系(https://huggingface.co/papers?q=hierarchical%20taxonomy),并通过改进的合成框架创建了包含1200万组高质量编辑对的海量数据集ConceptEdit-12M(https://huggingface.co/papers?q=ConceptEdit-12M)。这种库驱动方法有效纠正了生成数据的分布坍缩问题,同时确保高数据保真度。此外,我们提出密集监督训练策略(https://huggingface.co/papers?q=dense%20supervision%20training%20strategy),可将多个互不干扰的概念(https://huggingface.co/papers?q=non-interfering%20concepts)合成为单个图像对。该策略通过提供更丰富的学习信号,显著提升了训练效率与整体模型性能。训练结果验证了我们策略的有效性,性能显著优于现有研究。最后,我们推出ConceptEdit-Bench(https://huggingface.co/papers?q=ConceptEdit-Bench)——一套精细化评估体系,可用于诊断模型在大量真实场景中的能力表现。
查看arXiv页面 (https://arxiv.org/abs/2608.16812) 查看PDF (https://arxiv.org/pdf/2608.16812) GitHub5 (https://github.com/inclusionAI/ConceptEdit) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16812)
在您的智能助手中获取本文:
hf papers read 2608\.16812
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无关联模型
在模型README.md中引用arxiv.org/abs/2608.16812,即可从本页面建立链接。
引用本文的数据集2
inclusionAI/ConceptEdit-12M 约3小时前更新 • 178 • 2 (https://huggingface.co/datasets/inclusionAI/ConceptEdit-12M)
inclusionAI/ConceptEdit-Bench 预览• 约20小时前更新 • 1 (https://huggingface.co/datasets/inclusionAI/ConceptEdit-Bench)
引用本文的Space0
无关联Space
在Space README.md中引用arxiv.org/abs/2608.16812,即可从本页面建立链接。
包含本文的合集0
无包含本文的合集
将本文添加至合集 (https://huggingface.co/new-collection) 即可从本页面建立链接。
相似文章
Delta-Adapter:通过单对监督实现可扩展的基于示例的图像编辑
Delta-Adapter 通过从预训练视觉编码器中提取语义 delta 并通过基于 Perceiver 的适配器注入它们,实现了使用单对监督的基于示例的图像编辑,提高了准确性和泛化能力。
HP-Edit:面向图像编辑的人类偏好后训练框架
HP-Edit 提出一种后训练框架,通过 RLHF 将基于扩散的图像编辑模型与人类偏好对齐,依托全新 5 万张真实场景数据集及自动 VLM 评估器。
Abra:扩散图像训练的缩放研究
本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。
Uni-Edit:智能编辑是统一模型调优的通用任务
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
从计划到像素:学习规划和编排实现开放式图像编辑
一个针对长序列图像编辑的体验式框架,将规划与奖励驱动的执行相结合,以提高复杂多步编辑的连贯性和可靠性。