UniWorld-Design:从像素生成到图层原生设计

Hugging Face Daily Papers 论文

摘要

UniWorld-Design 是一个以语义 RGBA 图层为原子单元重新定义图像生成的框架,包含用于生成分层资产的 T2RGBA 和用于将图像分解为可编辑图层的 I2L,在 Crello 基准测试上取得了最先进的结果。

我们介绍了 UniWorld-Design,一个将图像生成从平面像素合成重新定义为结构化视觉组合的框架,以语义 RGBA 图层作为生成、理解和编辑的原子单元。我们的关键洞察是:像素定义了图像如何渲染,而图层定义了图像如何创建、理解和编辑。正如人类设计师通过图层而非原始像素来创建和操作视觉内容,UniWorld-Design 为多模态生成模型提供了图层原生的设计空间。UniWorld-Design 包含两个模型。文本到 RGBA(T2RGBA)模型直接从文本生成独立的 RGBA 资产。图像到图层(I2L)模型以成品图像、全局指令和逐层提示为条件,联合生成有序、完整的语义 RGBA 图层。其指令接口支持顶层分解、递归分解和定向提取,使分层成为智能体编辑中可指令寻址的操作。由于 I2L 学习的是完整的语义对象而非可见像素分区,其图层在移动或移除后仍保持可用。在 Crello 基准测试上,I2L 将每层 RGB L1 误差降低了 37%,相对于 Qwen-Image-Layered 在 Alpha Soft IoU 上取得了 34% 的相对提升。此外,T2RGBA 取得了最高的 CLIP Score,优于 LayerDiffuse 和 OmniAlpha。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:43

论文页面 - UniWorld-Design:从像素生成到图层原生设计

来源:https://huggingface.co/papers/2608.03971

作者:

,

,

,

,

,

,

,

,

,

,

摘要

我们提出了 UniWorld-Design,这是一个将图像生成从平面像素合成重新定义为结构化视觉组合的框架,以语义 RGBA 图层作为生成、理解和编辑的原子单元。我们的关键洞察是:像素定义了图像的渲染方式,而图层定义了图像的创建、理解和编辑方式。正如人类设计师通过图层而非原始像素来创建和操作视觉内容,UniWorld-Design 为多模态生成模型配备了一个图层原生的设计空间。

UniWorld-Design 包含两个模型。Text-to-RGBA(T2RGBA)模型直接从文本生成独立的 RGBA 素材。Image-to-Layer(I2L)模型以成品图像、全局指令和逐图层提示为条件,联合生成有序且完整的语义 RGBA 图层。其指令接口支持顶层分解、递归分解和定向提取,使分层成为一种可通过指令寻址的操作,适用于智能体编辑。由于 I2L 学习的是完整的语义对象而非可见像素分区,因此其图层在移动或移除后仍然可用。在 Crello 基准测试中,I2L 将逐层 RGB L1 误差降低了 37%,并在 Alpha SoftIoU 上相比 Qwen-Image-Layered 取得了 34% 的相对提升。此外,T2RGBA 取得了最高的 CLIPScore,优于 LayerDiffuse 和 OmniAlpha。

查看 arXiv 页面(https://arxiv.org/abs/2608.03971)| 查看 PDF(https://arxiv.org/pdf/2608.03971)| 项目页面(https://rabbitvis.rabbitpre.com/)| 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.03971)

在你的智能体中获取此论文:

hf papers read 2608.03971

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型关联此论文。

在模型 README.md 中引用 arxiv.org/abs/2608.03971,即可从本页面关联它。

引用此论文的数据集 0

暂无数据集关联此论文。

在数据集 README.md 中引用 arxiv.org/abs/2608.03971,即可从本页面关联它。

引用此论文的 Spaces 0

暂无 Space 关联此论文。

在 Space README.md 中引用 arxiv.org/abs/2608.03971,即可从本页面关联它。

包含此论文的收藏 0

暂无收藏包含此论文。

将此论文添加到一个收藏(https://huggingface.co/new-collection)中,即可从本页面关联它。

相似文章

PixWorld:在像素空间中统一3D场景生成与重建

Hugging Face Daily Papers

PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。

ReDesign:通过智能体分解从图像中恢复可编辑设计结构

Hugging Face Daily Papers

ReDesign是一个智能体框架,通过跨模态选择和组合专门工具,从光栅图像中恢复可编辑的图层层次结构,并引入优雅校验以防止错误累积。它还引入了FigmaEditReplay基准测试,用于大规模评估可编辑性,在基线之上实现了高视觉保真度和卓越的可编辑性。