PixVerve:利用大规模高质量数据集推动原生UHR图像生成至100MP

Hugging Face Daily Papers 论文

摘要

本文介绍了PixVerve-95K,一个包含95K张超高清(100MP)图像及标注的大规模开源数据集,以及PixVerve-Bench,一个用于评估原生100MP文本到图像生成的基准,将现有T2I模型扩展到前所未有的分辨率。

文本到图像(T2I)模型近期在1K和2K分辨率方面取得了显著进展。随着对更佳视觉体验的强烈渴望以及成像技术的快速发展,对超高清(UHR)图像生成的需求大幅增长。然而,由于高分辨率内容的稀缺性和复杂性,UHR图像生成面临巨大挑战。在本文中,我们首先介绍了PixVerve-95K,一个通过精心设计的数据管道整理的高质量开源UHR T2I数据集,包含95K张涵盖多种场景的图像(每张图像像素数至少为1亿(100M))以及七维标注。基于我们的大规模图像-文本数据集,我们率先通过三种训练方案将多种T2I基础模型扩展到原生100MP生成。最后,结合传统指标和基于多模态大语言模型的评估,我们提出的PixVerve-Bench基准为UHR图像建立了涵盖视觉质量和语义对齐的全面评估协议。在基准上的大量实验结果以及对训练策略的建设性探索,共同为未来的突破提供了宝贵见解。
查看原文
查看缓存全文

缓存时间: 2026/05/20 10:37

论文页面 - PixVerve: 借助大规模高质量数据集推进原生超高清图像生成至100MP

来源:https://huggingface.co/papers/2605.20147 作者:

摘要

本文引入了一个大规模超高清图像-文本数据集与评估基准,旨在推进超高清文本到图像生成能力的发展。

近年来,文本到图像(T2I)模型在1K和2K分辨率上取得了显著进展。随着人们对更好视觉体验的极度渴望以及成像技术的快速发展,对Ultra-High-Resolution (https://huggingface.co/papers?q=Ultra-High-Resolution) (UHR) 图像生成的需求大幅增长。然而,由于高分辨率内容的稀缺性和复杂性,超高清图像生成面临着巨大挑战。本文首先介绍了PixVerve-95K (https://huggingface.co/papers?q=PixVerve-95K),这是一个通过精心设计的数据流水线构建的高质量、开源超高清T2I数据集,包含95K张覆盖多种场景的图像(每张图像的最小像素数为100M)以及七维标注。基于我们的大规模image-text dataset (https://huggingface.co/papers?q=image-text%20dataset),我们率先将多种T2I基础模型扩展到原生100MP生成,并采用了三种训练方案。最后,结合传统指标与multimodal large language model (https://huggingface.co/papers?q=multimodal%20large%20language%20model) 的评估,我们提出的PixVerve-Bench (https://huggingface.co/papers?q=PixVerve-Bench) 基准为超高清图像建立了一个全面的评估协议,涵盖visual quality (https://huggingface.co/papers?q=visual%20quality) 和semantic alignment (https://huggingface.co/papers?q=semantic%20alignment)。在我们的基准上进行的广泛实验结果以及对训练策略的建设性探索,共同为未来的突破提供了宝贵的见解。

查看 arXiv 页面 (https://arxiv.org/abs/2605.20147) 查看 PDF (https://arxiv.org/pdf/2605.20147) 项目页面 (https://haojunchen663.github.io/projects/PixVerve/) GitHub5 (https://github.com/HaojunChen663/PixVerve-95K) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.20147)

在你的代理中获取此论文:

hf papers read 2605.20147

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.20147 以在此页面链接。

引用本论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.20147 以在此页面链接。

引用本论文的 Spaces0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.20147 以在此页面链接。

包含本论文的收藏0

没有收藏包含此论文

请将此论文添加到一个collection (https://huggingface.co/new-collection) 中,以在此页面链接。

相似文章

HiDream-ai/HiDream-O1-Image

Hugging Face Models Trending

HiDream-ai 已开源 HiDream-O1-Image(8B),这是一款基于像素级统一 Transformer(UiT)构建的统一图像生成基础模型,原生支持文本生成图像、图像编辑以及主体驱动的个性化生成,分辨率最高可达 2048×2048,无需外部 VAE 或独立文本编码器。该模型在 Artificial Analysis 文生图竞技场中首次亮相即位列第 8,是目前领先的开放权重文生图模型之一。

HiDream-ai/HiDream-O1-Image-Dev

Hugging Face Models Trending

HiDream-ai 发布了 HiDream-O1-Image-Dev,这是一个拥有 80 亿参数的开源图像生成模型,采用像素级统一 Transformer 架构,无需外部 VAE。该模型在 Artificial Analysis Text to Image Arena 排行榜中位列第 8,支持高达 2,048x2,048 的超高分辨率图像生成。