ReDesign:通过智能体分解从图像中恢复可编辑设计结构
摘要
ReDesign是一个智能体框架,通过跨模态选择和组合专门工具,从光栅图像中恢复可编辑的图层层次结构,并引入优雅校验以防止错误累积。它还引入了FigmaEditReplay基准测试,用于大规模评估可编辑性,在基线之上实现了高视觉保真度和卓越的可编辑性。
查看缓存全文
缓存时间: 2026/07/29 07:51
论文页面 - ReDesign:通过智能体分解从图像中恢复可编辑设计结构
来源:https://huggingface.co/papers/2607.25565
摘要
从栅格图像中恢复可编辑设计文件是现代设计工作流中常见且成本高昂的瓶颈,但由于可编辑性依赖于恢复多模态属性(如排版、矢量几何、颜色、分组和图层顺序),这一任务仍然极具挑战性。我们提出 ReDesign,一个智能体框架,通过跨模态选择和组合专用工具,逐步构建可编辑的图层层次结构。为了在工具输出不完美的情况下保持这一长决策过程的可靠性,我们引入了优雅验证机制,在每次扩展时提供本地化的接受、剪枝或重试反馈,从而防止错误累积并避免大规模重运行。为了大规模评估可编辑性,我们推出了 FigmaEditReplay 基准测试,包含 909 个原始 Figma 文件以及 14,796 条受控编辑指令,这些指令在重建输出上回放。在该基准测试及标准重建指标上,ReDesign 在保持高视觉保真度的同时,在布局、颜色和文本编辑方面实现了最高的可编辑性,超越了分层分解基线和串行工具使用流水线。
查看 arXiv 页面 (https://arxiv.org/abs/2607.25565)
查看 PDF (https://arxiv.org/pdf/2607.25565)
项目页面 (https://jintae-00.github.io/ReDesign/)
GitHub (https://github.com/jintae-00/ReDesign)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25565)
在您的智能体中获取此论文:
hf papers read 2607\.25565
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型与此论文关联
请在模型 README.md 中引用 arxiv.org/abs/2607.25565,以便从此页面链接。
引用此论文的数据集 1
Jintae-Park/ReDesign-Figma909 更新于约4小时前 • 130 • 1 (https://huggingface.co/datasets/Jintae-Park/ReDesign-Figma909)
引用此论文的 Spaces 0
无 Space 与此论文关联
请在 Space README.md 中引用 arxiv.org/abs/2607.25565,以便从此页面链接。
包含此论文的集合 1
相似文章
可编辑视觉设计
由视觉语言模型引导的编码代理通过合成视觉资源和优化HTML/CSS布局,生成可编辑的分层设计,实现具有精确控制的后编辑。
Designer-RSI:从用户流量中演化程序性记忆用于代理式图形设计
该持续适应框架通过用户流量演化程序性记忆以用于代理式图形设计,在无需权重更新和人工标签的条件下提升执行成功率。
@HuggingPapers: Editable Visual Design 全新范式:编程智能体以 VLM 为创意大脑、图像模型为视觉模拟……
一种全新范式使编程智能体能够以 VLM 为创意大脑、图像模型为视觉模拟器,生成包含真实文字、解耦图层且完全可编辑的海报与信息图。
这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准
本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。
从计划到像素:学习规划和编排实现开放式图像编辑
一个针对长序列图像编辑的体验式框架,将规划与奖励驱动的执行相结合,以提高复杂多步编辑的连贯性和可靠性。