从计划到像素:学习规划和编排实现开放式图像编辑
摘要
一个针对长序列图像编辑的体验式框架,将规划与奖励驱动的执行相结合,以提高复杂多步编辑的连贯性和可靠性。
查看缓存全文
缓存时间: 2026/05/18 06:24
论文页面 - 从计划到像素:学习规划与编排以实现开放式图像编辑
来源:https://huggingface.co/papers/2605.15181
摘要
一种用于长程图像编辑的经验性框架,将规划与奖励驱动的执行相结合,以提升复杂多步编辑的连贯性和可靠性。
现代图像编辑模型能够产生逼真的效果,但在处理抽象的多步指令(例如“让这个广告更符合素食主义风格”)时表现不佳。以往基于智能体的方法会分解此类任务,但依赖于手工制作的流水线或教师模仿,限制了灵活性,并使学习与实际的编辑结果脱钩。我们提出了一种用于长程图像编辑的经验性框架,其中规划器(planner)生成结构化的原子分解(atomic decompositions),编排器(orchestrator)选择工具和区域来执行每一步。视觉语言评判器(vision language judge)提供基于结果的奖励,用于衡量指令遵循(instruction adherence)和视觉质量(visual quality)。编排器经过训练以最大化这些奖励,而成功的轨迹则用于优化规划器。通过将规划与奖励驱动的执行紧密耦合,我们的方法比单步或基于规则的多步基线产生了更连贯、更可靠的编辑结果。
查看 arXiv 页面 (https://arxiv.org/abs/2605.15181) 查看 PDF (https://arxiv.org/pdf/2605.15181) 项目页面 (https://anisundar18.github.io/Plan2Pix.github.io/) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.15181)
在您的智能体中获取此论文:
hf papers read 2605\.15181
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型关联此论文
请在模型的 README.md 中引用 arxiv.org/abs/2605.15181 以从此页面链接。
引用此论文的数据集0
无数据集关联此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2605.15181 以从此页面链接。
引用此论文的 Space 应用0
无 Space 应用关联此论文
请在 Space 应用的 README.md 中引用 arxiv.org/abs/2605.15181 以从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
请将此论文添加至收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
HP-Edit:面向图像编辑的人类偏好后训练框架
HP-Edit 提出一种后训练框架,通过 RLHF 将基于扩散的图像编辑模型与人类偏好对齐,依托全新 5 万张真实场景数据集及自动 VLM 评估器。
CanvasAgent: 通过视觉工具编排实现复杂图像创建与编辑
本文介绍了 CanvasCraft,一个用于复杂图像创建与编辑的大规模多模态工具使用数据集,以及 CanvasAgent,一个通过多轮交互和混合奖励优化来学习编排异构视觉工具的工具增强型多模态智能体。
ReDesign:通过智能体分解从图像中恢复可编辑设计结构
ReDesign是一个智能体框架,通过跨模态选择和组合专门工具,从光栅图像中恢复可编辑的图层层次结构,并引入优雅校验以防止错误累积。它还引入了FigmaEditReplay基准测试,用于大规模评估可编辑性,在基线之上实现了高视觉保真度和卓越的可编辑性。
SmartPhotoCrafter:统一推理、生成与优化的自动摄影图像编辑
SmartPhotoCrafter 提出一条无需显式人工指令即可统一质量理解与增强的自动摄影图像编辑流水线,在真实感增强任务上超越现有生成模型。
接下来编辑什么:对话系统中视觉对齐的图像编辑后续建议
一个三阶段多模态框架改进了对话式图像生成系统中的后续编辑推荐,利用SFT、多目标强化学习和视觉验证来减少视觉不一致性,并在实时A/B测试中提升参与度指标。