UniWorld-Design:从像素生成到图层原生设计
摘要
UniWorld-Design 是一个以语义 RGBA 图层为原子单元重新定义图像生成的框架,包含用于生成分层资产的 T2RGBA 和用于将图像分解为可编辑图层的 I2L,在 Crello 基准测试上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/08/05 05:43
论文页面 - UniWorld-Design:从像素生成到图层原生设计
来源:https://huggingface.co/papers/2608.03971
作者:
,
,
,
,
,
,
,
,
,
,
摘要
我们提出了 UniWorld-Design,这是一个将图像生成从平面像素合成重新定义为结构化视觉组合的框架,以语义 RGBA 图层作为生成、理解和编辑的原子单元。我们的关键洞察是:像素定义了图像的渲染方式,而图层定义了图像的创建、理解和编辑方式。正如人类设计师通过图层而非原始像素来创建和操作视觉内容,UniWorld-Design 为多模态生成模型配备了一个图层原生的设计空间。
UniWorld-Design 包含两个模型。Text-to-RGBA(T2RGBA)模型直接从文本生成独立的 RGBA 素材。Image-to-Layer(I2L)模型以成品图像、全局指令和逐图层提示为条件,联合生成有序且完整的语义 RGBA 图层。其指令接口支持顶层分解、递归分解和定向提取,使分层成为一种可通过指令寻址的操作,适用于智能体编辑。由于 I2L 学习的是完整的语义对象而非可见像素分区,因此其图层在移动或移除后仍然可用。在 Crello 基准测试中,I2L 将逐层 RGB L1 误差降低了 37%,并在 Alpha SoftIoU 上相比 Qwen-Image-Layered 取得了 34% 的相对提升。此外,T2RGBA 取得了最高的 CLIPScore,优于 LayerDiffuse 和 OmniAlpha。
查看 arXiv 页面(https://arxiv.org/abs/2608.03971)| 查看 PDF(https://arxiv.org/pdf/2608.03971)| 项目页面(https://rabbitvis.rabbitpre.com/)| 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.03971)
在你的智能体中获取此论文:
hf papers read 2608.03971
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型关联此论文。
在模型 README.md 中引用 arxiv.org/abs/2608.03971,即可从本页面关联它。
引用此论文的数据集 0
暂无数据集关联此论文。
在数据集 README.md 中引用 arxiv.org/abs/2608.03971,即可从本页面关联它。
引用此论文的 Spaces 0
暂无 Space 关联此论文。
在 Space README.md 中引用 arxiv.org/abs/2608.03971,即可从本页面关联它。
包含此论文的收藏 0
暂无收藏包含此论文。
将此论文添加到一个收藏(https://huggingface.co/new-collection)中,即可从本页面关联它。
相似文章
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。
PixWorld:在像素空间中统一3D场景生成与重建
PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。
UltraFlux:数据-模型协同设计实现多种宽高比下的高质量原生4K文本到图像生成
UltraFlux 提出了一种数据-模型协同设计方法,用于多种宽高比下的原生4K文本到图像生成,解决了位置编码、VAE压缩和优化挑战。它优于现有的开源基线,并达到了与 Seedream 4.0 等专有模型相当的水平。
Qwen-Image-3.0:丰富内容、真实细节、深度知识(6分钟阅读)
Qwen-Image-3.0 是第三代基础图像生成模型,支持高达 4.5k token 的输入、12 种语言的原生渲染,并能模拟网页、游戏等界面,利用丰富的世界知识实现实际部署。
ReDesign:通过智能体分解从图像中恢复可编辑设计结构
ReDesign是一个智能体框架,通过跨模态选择和组合专门工具,从光栅图像中恢复可编辑的图层层次结构,并引入优雅校验以防止错误累积。它还引入了FigmaEditReplay基准测试,用于大规模评估可编辑性,在基线之上实现了高视觉保真度和卓越的可编辑性。