ReDesign:通过智能体分解从图像中恢复可编辑设计结构

Hugging Face Daily Papers 论文

摘要

ReDesign是一个智能体框架,通过跨模态选择和组合专门工具,从光栅图像中恢复可编辑的图层层次结构,并引入优雅校验以防止错误累积。它还引入了FigmaEditReplay基准测试,用于大规模评估可编辑性,在基线之上实现了高视觉保真度和卓越的可编辑性。

从光栅图像中恢复可编辑的设计文件是现代设计工作流中常见且成本高昂的瓶颈,但由于可编辑性依赖于恢复多模态属性(如排版、矢量几何、颜色、分组和图层顺序),因此仍然具有挑战性。我们提出了ReDesign,这是一种智能体框架,通过跨模态选择和组合专门工具来逐步构建可编辑的图层层次结构。为了在工具输出不完美的情况下保持这一长决策过程的可靠性,我们在每次扩展中引入优雅校验,提供本地接受、修剪或重试反馈,从而防止错误累积并避免大规模重跑。为了大规模评估可编辑性,我们引入了Figma Edit Replay基准测试,包含909个原始Figma文件和14,796个受控编辑指令,这些指令会在重建输出上重放编辑。在该基准测试和标准重建指标上,ReDesign在布局、颜色和文本编辑中实现了高视觉保真度,同时提供了最高的可编辑性,优于分层分解基线和串行工具使用流程。
查看原文
查看缓存全文

缓存时间: 2026/07/29 07:51

论文页面 - ReDesign:通过智能体分解从图像中恢复可编辑设计结构

来源:https://huggingface.co/papers/2607.25565

摘要

从栅格图像中恢复可编辑设计文件是现代设计工作流中常见且成本高昂的瓶颈,但由于可编辑性依赖于恢复多模态属性(如排版、矢量几何、颜色、分组和图层顺序),这一任务仍然极具挑战性。我们提出 ReDesign,一个智能体框架,通过跨模态选择和组合专用工具,逐步构建可编辑的图层层次结构。为了在工具输出不完美的情况下保持这一长决策过程的可靠性,我们引入了优雅验证机制,在每次扩展时提供本地化的接受、剪枝或重试反馈,从而防止错误累积并避免大规模重运行。为了大规模评估可编辑性,我们推出了 FigmaEditReplay 基准测试,包含 909 个原始 Figma 文件以及 14,796 条受控编辑指令,这些指令在重建输出上回放。在该基准测试及标准重建指标上,ReDesign 在保持高视觉保真度的同时,在布局、颜色和文本编辑方面实现了最高的可编辑性,超越了分层分解基线和串行工具使用流水线。

查看 arXiv 页面 (https://arxiv.org/abs/2607.25565)
查看 PDF (https://arxiv.org/pdf/2607.25565)
项目页面 (https://jintae-00.github.io/ReDesign/)
GitHub (https://github.com/jintae-00/ReDesign)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25565)

在您的智能体中获取此论文:

hf papers read 2607\.25565

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型与此论文关联

请在模型 README.md 中引用 arxiv.org/abs/2607.25565,以便从此页面链接。

引用此论文的数据集 1

Jintae-Park/ReDesign-Figma909 更新于约4小时前 • 130 • 1 (https://huggingface.co/datasets/Jintae-Park/ReDesign-Figma909)

引用此论文的 Spaces 0

无 Space 与此论文关联

请在 Space README.md 中引用 arxiv.org/abs/2607.25565,以便从此页面链接。

包含此论文的集合 1

相似文章

可编辑视觉设计

Hugging Face Daily Papers

由视觉语言模型引导的编码代理通过合成视觉资源和优化HTML/CSS布局,生成可编辑的分层设计,实现具有精确控制的后编辑。

这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准

Hugging Face Daily Papers

本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。