从语料库到协同进化能力:面向通用图像生成的以能力为中心的数据设计

Hugging Face Daily Papers 论文

摘要

本文介绍了一种基于能力的数据基础设施,通过课程调度,利用异构监督训练通用图像生成模型,以应对多样化的生成任务。

大规模图像生成得益于数据规模、质量、重平衡和重标注的进步,但传统流程通常孤立地优化任务特定的数据集。一个核心挑战不仅是如何策划每个任务特定的语料库,还包括如何根据生成能力之间的依赖关系组织异构监督。我们提出了一种以能力驱动的数据基础设施,将特定能力的监督构建与能力对齐的课程调度相结合。其三个专门但可互操作的数据引擎构建了互补的关系监督,用于文本-图像对齐、图像间转换和图像-知识关联,而标题专家则跨任务和粒度对齐文本到图像和编辑监督。多阶段课程沿着能力获取的依赖顺序共同演化任务组成、视觉概念分布、数据质量和图像分辨率,能力感知评估通过针对性检索、专家构建和差距感知重采样来闭环。在规模上,该框架策划了一个4.4亿图像的文本到图像语料库、1.2亿编辑对和超过2700万图像-实体对。利用这一基础设施,我们从头训练了两种规模的多模态扩散模型,分别为3B和6B。我们在CPI-Bench上进行了定量评估,并在多样化的文本到图像和编辑场景中进行了定性评估。实验结果展示了广泛的视觉覆盖、多功能渲染和跨生成能力的有效迁移。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:57

论文页面 - 从语料到协同进化能力:面向通用图像生成的能力中心化数据设计

来源:https://huggingface.co/papers/2608.18076 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

一个具备课程调度与专用数据引擎的能力驱动数据基础设施,通过策展的异构监督数据,训练大型多模态扩散模型以执行多样化的生成任务。

大规模图像生成已受益于数据规模、质量、重平衡和重描述方面的进步,但传统流程通常孤立优化特定任务的数据集。核心挑战不仅在于如何为每个任务策划语料库,更在于如何根据生成能力间的依赖关系来组织异构监督。我们提出一种能力驱动的数据基础设施,它将特定能力的监督构建与能力对齐的课程调度相结合。其三个专用但可互操作的数据引擎为文本-图像对齐图像间转换图像-知识关联构建互补的关联监督,同时描述专家跨任务和粒度对齐T2I和编辑监督。一个多阶段课程根据能力获取的依赖顺序,协同进化任务组合、视觉概念分布、数据质量和图像分辨率,并通过能力感知评估实现针对性检索、专家构建和差距感知重采样来形成闭环。该框架规模化地策划了一个包含4.4亿张图像的T2I语料库、1.2亿个编辑对以及超过2700万个图像-实体对。基于此基础设施,我们从头训练了两种规模(30亿和60亿参数)的多模态扩散模型。我们在CPI-Bench上进行了定量评估,并在多种文本到图像和编辑场景中进行了定性评估。实验结果展示了广泛的视觉覆盖、多功能的渲染能力以及跨生成能力的有效迁移。

查看arXiv页面 (https://arxiv.org/abs/2608.18076) 查看PDF (https://arxiv.org/pdf/2608.18076) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18076)

在您的代理中获取此论文:

hf papers read 2608\.18076

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.18076以从本页链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.18076以从本页链接它。

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.18076以从本页链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

通过同质-异质分割的合成图像生成后策展

arXiv cs.LG

本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。

视频生成模型是通用视觉学习者

Hugging Face Daily Papers

本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。