合成分层设计数据是否有利于分层设计分解?

Hugging Face Daily Papers 论文

摘要

探究合成分层数据是否能改善图形设计分解,发现合成数据优于不可扩展的数据集,并能够实现均衡的层数分布。

近年来,图像生成技术的进步使得生成高质量图像变得容易。然而,这些输出本质上是扁平化的,将前景元素、背景和文本纠缠在固定画布中。因此,灵活的生成后编辑仍然具有挑战性,暴露出通往实际可用性的明显最后一公里差距。现有方法要么依赖稀缺的专有分层资源,要么从有限的结构先验构建部分合成数据。然而,这两种策略在可扩展性方面都面临根本性挑战。在这项工作中,我们研究纯合成分层数据是否能改善图形设计分解。我们假设,在图形设计中,有效的分解不需要像自然图像合成那样精确地建模层间依赖关系,因为设计元素通常被有意排列为模块化和语义可分离的组件。具体来说,我们基于最先进的层分解框架CLD基线进行了一项以数据为中心的研究。在此基础上,我们构建了自己的合成数据集SynLayers,使用视觉语言模型生成文本监督,并使用VLM预测的边界框自动进行推理输入。我们的研究揭示了三个关键发现:(1)即使仅使用合成数据进行训练,也能优于不可扩展的替代方案,例如广泛使用的PrismLayersPro数据集,证明了其作为可扩展且有效替代方案的可行性;(2)性能随着训练数据规模的增加而持续提升,但在约50K样本时增益开始饱和;(3)合成数据能够实现对层数分布的均衡控制,避免了真实世界数据集中常见的层数不平衡。我们希望这项以数据为中心的研究能够鼓励更广泛地采用合成数据作为分层设计编辑系统的实用基础。
查看原文
查看缓存全文

缓存时间: 2026/05/15 04:23

Paper page - Does Synthetic Layered Design Data Benefit Layered Design Decomposition?

来源: https://huggingface.co/papers/2605.15167

摘要

合成分层图像数据通过实现可扩展训练和更好的图层分布控制,相较于传统方法,提升了图形设计分解的效果。

近期图像生成领域的进展使得生成高质量图像变得轻而易举。然而,这些输出本质上是被压平的——前景元素、背景和文本都混杂在一个固定画布上。因此,生成后的灵活编辑仍具有挑战性,暴露出通往实际可用性之间的明显“最后一英里“差距。现有方法要么依赖稀缺的专有分层资产,要么从有限的结构先验中构建部分合成数据,但两种策略在可扩展性上都面临根本性挑战。在本工作中,我们探究纯合成分层数据能否改进图形设计分解。我们假设:在图形设计中,有效的分解并不需要像自然图像合成那样精确地建模层间依赖关系,因为设计元素通常被有意地安排为模块化且语义可分离的组件。具体而言,我们基于 CLD 基线(一种最先进的图层分解框架)开展了一项以数据为中心的研究。在此基线基础上,我们构建了自己的合成数据集 SynLayers,利用视觉语言模型生成文本监督,并使用 VLM 预测的边界框来自动化推理输入。我们的研究揭示了三个关键发现:(1) 即使使用纯合成数据进行训练,也能超越非可扩展的替代方案(例如广泛使用的 PrismLayersPro 数据集),证明了其作为可扩展且有效替代方案的可行性;(2) 随着训练数据规模的增加,性能持续提升,但在约 50K 样本时增益开始饱和;(3) 合成数据能够对图层数量分布进行均衡控制,避免了真实世界数据集中常见的图层数量不平衡问题。我们希望这项以数据为中心的研究能鼓励更广泛地将合成数据作为分层设计编辑系统的实用基础。

查看 arXiv 页面 (https://arxiv.org/abs/2605.15167)查看 PDF (https://arxiv.org/pdf/2605.15167)GitHub3 (https://github.com/YangHaolin0526/SynLayers)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.15167)

引用本文的模型1

SynLayers/Bbox-caption-8b Image-Text-to-Text• 9B• 更新于约2小时前 • 530 • 4 (https://huggingface.co/SynLayers/Bbox-caption-8b)

引用本文的数据集0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.15167 即可从此页面链接。

引用本文的空间1

包含本文的收藏0

无收藏包含此论文

将本文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

高效数据合成的一个信息论准则

arXiv cs.LG

本文从信息论角度解释了合成数据何时会改善或降低LLM训练效果,区分了信息开放和信息封闭的生成循环,并通过数据处理不等式解释了模型崩溃的原因。

ReDesign:通过智能体分解从图像中恢复可编辑设计结构

Hugging Face Daily Papers

ReDesign是一个智能体框架,通过跨模态选择和组合专门工具,从光栅图像中恢复可编辑的图层层次结构,并引入优雅校验以防止错误累积。它还引入了FigmaEditReplay基准测试,用于大规模评估可编辑性,在基线之上实现了高视觉保真度和卓越的可编辑性。

UniWorld-Design:从像素生成到图层原生设计

Hugging Face Daily Papers

UniWorld-Design 是一个以语义 RGBA 图层为原子单元重新定义图像生成的框架,包含用于生成分层资产的 T2RGBA 和用于将图像分解为可编辑图层的 I2L,在 Crello 基准测试上取得了最先进的结果。

声明式数据服务:用于组合数据系统的结构化智能体发现

arXiv cs.AI

本文提出了声明式数据服务(DDS),这是一种从声明式用户意图出发,对数据系统组合进行结构化智能体发现的架构。它将全局搜索分解为有界子搜索,并在一个交易后端工作负载上展示了收敛性,而在此负载上无界发现会失败。