从语料库到协同进化能力:面向通用图像生成的以能力为中心的数据设计
摘要
本文介绍了一种基于能力的数据基础设施,通过课程调度,利用异构监督训练通用图像生成模型,以应对多样化的生成任务。
查看缓存全文
缓存时间: 2026/08/19 03:57
论文页面 - 从语料到协同进化能力:面向通用图像生成的能力中心化数据设计
来源:https://huggingface.co/papers/2608.18076 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一个具备课程调度与专用数据引擎的能力驱动数据基础设施,通过策展的异构监督数据,训练大型多模态扩散模型以执行多样化的生成任务。
大规模图像生成已受益于数据规模、质量、重平衡和重描述方面的进步,但传统流程通常孤立优化特定任务的数据集。核心挑战不仅在于如何为每个任务策划语料库,更在于如何根据生成能力间的依赖关系来组织异构监督。我们提出一种能力驱动的数据基础设施,它将特定能力的监督构建与能力对齐的课程调度相结合。其三个专用但可互操作的数据引擎为文本-图像对齐、图像间转换和图像-知识关联构建互补的关联监督,同时描述专家跨任务和粒度对齐T2I和编辑监督。一个多阶段课程根据能力获取的依赖顺序,协同进化任务组合、视觉概念分布、数据质量和图像分辨率,并通过能力感知评估实现针对性检索、专家构建和差距感知重采样来形成闭环。该框架规模化地策划了一个包含4.4亿张图像的T2I语料库、1.2亿个编辑对以及超过2700万个图像-实体对。基于此基础设施,我们从头训练了两种规模(30亿和60亿参数)的多模态扩散模型。我们在CPI-Bench上进行了定量评估,并在多种文本到图像和编辑场景中进行了定性评估。实验结果展示了广泛的视觉覆盖、多功能的渲染能力以及跨生成能力的有效迁移。
查看arXiv页面 (https://arxiv.org/abs/2608.18076) 查看PDF (https://arxiv.org/pdf/2608.18076) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18076)
在您的代理中获取此论文:
hf papers read 2608\.18076
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.18076以从本页链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.18076以从本页链接它。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.18076以从本页链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
超越可教知识的搜索:发展智能体视觉生成中的知识边界
本文通过引入SearchGen-20K基准和SearchGen-Corpus-1M语料库,解决了视觉生成中的知识边界问题,并提出了一种先教后搜索的协同训练框架,以处理超出生成器训练数据的、不断演化的长尾用户请求。
视频生成器作为通用视觉模型(8分钟阅读)
GenCeption 将预训练的视频生成模型重新利用为一个统一的单次前馈视觉模型,在多个任务上以极高的数据效率实现了最先进的性能,标志着向通用视觉智能的转变。
通过同质-异质分割的合成图像生成后策展
本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。
视频生成模型是通用视觉学习者
本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。
SCOPE:面向复杂图像生成的结构化分解与条件技能编排
SCOPE 是一个基于规范引导的文生图框架,通过追踪语义承诺以更好地满足复杂的视觉意图。该框架引入了 Gen-Arena 基准测试,并在复杂的生成任务中展现了强大的性能。