PixVerve:利用大规模高质量数据集推动原生UHR图像生成至100MP
摘要
本文介绍了PixVerve-95K,一个包含95K张超高清(100MP)图像及标注的大规模开源数据集,以及PixVerve-Bench,一个用于评估原生100MP文本到图像生成的基准,将现有T2I模型扩展到前所未有的分辨率。
查看缓存全文
缓存时间: 2026/05/20 10:37
论文页面 - PixVerve: 借助大规模高质量数据集推进原生超高清图像生成至100MP
来源:https://huggingface.co/papers/2605.20147 作者:
、
、
、
、
、
、
、
、
、
、
、
、
摘要
本文引入了一个大规模超高清图像-文本数据集与评估基准,旨在推进超高清文本到图像生成能力的发展。
近年来,文本到图像(T2I)模型在1K和2K分辨率上取得了显著进展。随着人们对更好视觉体验的极度渴望以及成像技术的快速发展,对Ultra-High-Resolution (https://huggingface.co/papers?q=Ultra-High-Resolution) (UHR) 图像生成的需求大幅增长。然而,由于高分辨率内容的稀缺性和复杂性,超高清图像生成面临着巨大挑战。本文首先介绍了PixVerve-95K (https://huggingface.co/papers?q=PixVerve-95K),这是一个通过精心设计的数据流水线构建的高质量、开源超高清T2I数据集,包含95K张覆盖多种场景的图像(每张图像的最小像素数为100M)以及七维标注。基于我们的大规模image-text dataset (https://huggingface.co/papers?q=image-text%20dataset),我们率先将多种T2I基础模型扩展到原生100MP生成,并采用了三种训练方案。最后,结合传统指标与multimodal large language model (https://huggingface.co/papers?q=multimodal%20large%20language%20model) 的评估,我们提出的PixVerve-Bench (https://huggingface.co/papers?q=PixVerve-Bench) 基准为超高清图像建立了一个全面的评估协议,涵盖visual quality (https://huggingface.co/papers?q=visual%20quality) 和semantic alignment (https://huggingface.co/papers?q=semantic%20alignment)。在我们的基准上进行的广泛实验结果以及对训练策略的建设性探索,共同为未来的突破提供了宝贵的见解。
查看 arXiv 页面 (https://arxiv.org/abs/2605.20147) 查看 PDF (https://arxiv.org/pdf/2605.20147) 项目页面 (https://haojunchen663.github.io/projects/PixVerve/) GitHub5 (https://github.com/HaojunChen663/PixVerve-95K) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.20147)
在你的代理中获取此论文:
hf papers read 2605.20147
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.20147 以在此页面链接。
引用本论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.20147 以在此页面链接。
引用本论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.20147 以在此页面链接。
包含本论文的收藏0
没有收藏包含此论文
请将此论文添加到一个collection (https://huggingface.co/new-collection) 中,以在此页面链接。
相似文章
@drfeifei: 我非常兴奋于这个适用于大规模生成模型新时代的视觉生成新基准数据集…
介绍GPIC(Giant Permissive Image Corpus),一个大规模数据集,包含1亿个VLM标注的图像-文本对用于训练,以及100万个用于基准测试的对,完全许可用于研究和商业用途。
UltraFlux:数据-模型协同设计实现多种宽高比下的高质量原生4K文本到图像生成
UltraFlux 提出了一种数据-模型协同设计方法,用于多种宽高比下的原生4K文本到图像生成,解决了位置编码、VAE压缩和优化挑战。它优于现有的开源基线,并达到了与 Seedream 4.0 等专有模型相当的水平。
HiDream-ai/HiDream-O1-Image
HiDream-ai 已开源 HiDream-O1-Image(8B),这是一款基于像素级统一 Transformer(UiT)构建的统一图像生成基础模型,原生支持文本生成图像、图像编辑以及主体驱动的个性化生成,分辨率最高可达 2048×2048,无需外部 VAE 或独立文本编码器。该模型在 Artificial Analysis 文生图竞技场中首次亮相即位列第 8,是目前领先的开放权重文生图模型之一。
HiDream-ai/HiDream-O1-Image-Dev
HiDream-ai 发布了 HiDream-O1-Image-Dev,这是一个拥有 80 亿参数的开源图像生成模型,采用像素级统一 Transformer 架构,无需外部 VAE。该模型在 Artificial Analysis Text to Image Arena 排行榜中位列第 8,支持高达 2,048x2,048 的超高分辨率图像生成。
Urban-ImageNet: 大规模多模态数据集与城市空间感知评估框架
Urban-ImageNet是一个大规模多模态数据集和评估基准,用于从社交媒体图像进行城市空间感知,支持场景分类、跨模态检索和实例分割任务,覆盖中国24个城市的61个城市地点。