从计划到像素:学习规划和编排实现开放式图像编辑

Hugging Face Daily Papers 论文

摘要

一个针对长序列图像编辑的体验式框架,将规划与奖励驱动的执行相结合,以提高复杂多步编辑的连贯性和可靠性。

现代图像编辑模型能够生成逼真的结果,但在处理抽象的多步指令(例如,“让这个广告更素食友好”)时却力不从心。先前的基于智能体的方法能够分解此类任务,但依赖手工设计的流程或教师模仿,限制了灵活性,并使学习与实际编辑结果脱钩。我们提出了一个针对长序列图像编辑的体验式框架,其中规划器生成结构化的原子分解,编排器选择工具和区域来执行每一步。一个视觉语言评判器提供基于结果的奖励,用于评估指令遵循情况和视觉质量。编排器经过训练以最大化这些奖励,而成功的轨迹则用于优化规划器。通过将规划与奖励驱动的执行紧密耦合,我们的方法比单步或基于规则的多步基线方法产生了更连贯、更可靠的编辑结果。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:24

论文页面 - 从计划到像素:学习规划与编排以实现开放式图像编辑

来源:https://huggingface.co/papers/2605.15181

摘要

一种用于长程图像编辑的经验性框架,将规划与奖励驱动的执行相结合,以提升复杂多步编辑的连贯性和可靠性。

现代图像编辑模型能够产生逼真的效果,但在处理抽象的多步指令(例如“让这个广告更符合素食主义风格”)时表现不佳。以往基于智能体的方法会分解此类任务,但依赖于手工制作的流水线或教师模仿,限制了灵活性,并使学习与实际的编辑结果脱钩。我们提出了一种用于长程图像编辑的经验性框架,其中规划器(planner)生成结构化的原子分解(atomic decompositions),编排器(orchestrator)选择工具和区域来执行每一步。视觉语言评判器(vision language judge)提供基于结果的奖励,用于衡量指令遵循(instruction adherence)和视觉质量(visual quality)。编排器经过训练以最大化这些奖励,而成功的轨迹则用于优化规划器。通过将规划与奖励驱动的执行紧密耦合,我们的方法比单步或基于规则的多步基线产生了更连贯、更可靠的编辑结果。

查看 arXiv 页面 (https://arxiv.org/abs/2605.15181) 查看 PDF (https://arxiv.org/pdf/2605.15181) 项目页面 (https://anisundar18.github.io/Plan2Pix.github.io/) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.15181)

在您的智能体中获取此论文:

hf papers read 2605\.15181

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型关联此论文

请在模型的 README.md 中引用 arxiv.org/abs/2605.15181 以从此页面链接。

引用此论文的数据集0

无数据集关联此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2605.15181 以从此页面链接。

引用此论文的 Space 应用0

无 Space 应用关联此论文

请在 Space 应用的 README.md 中引用 arxiv.org/abs/2605.15181 以从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

请将此论文添加至收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

CanvasAgent: 通过视觉工具编排实现复杂图像创建与编辑

Hugging Face Daily Papers

本文介绍了 CanvasCraft,一个用于复杂图像创建与编辑的大规模多模态工具使用数据集,以及 CanvasAgent,一个通过多轮交互和混合奖励优化来学习编排异构视觉工具的工具增强型多模态智能体。

ReDesign:通过智能体分解从图像中恢复可编辑设计结构

Hugging Face Daily Papers

ReDesign是一个智能体框架,通过跨模态选择和组合专门工具,从光栅图像中恢复可编辑的图层层次结构,并引入优雅校验以防止错误累积。它还引入了FigmaEditReplay基准测试,用于大规模评估可编辑性,在基线之上实现了高视觉保真度和卓越的可编辑性。