一致性多参考图像编辑的评估-验证奖励

Hugging Face Daily Papers 论文

摘要

本文提出一种多维评估-验证奖励(EVR),用于多参考图像编辑模型的强化学习微调,提升视觉一致性与和谐度。

尽管近期图像编辑模型取得了快速发展,多参考编辑仍然具有挑战性,尤其是在保持参考图像之间的视觉一致性和确保整体视觉和谐方面。强化学习已被证明在文本到图像生成和单图像编辑中非常有效,但其扩展到多参考编辑受到缺乏能够捕捉多图像关系约束的合适奖励模型的阻碍。此外,天真地使用多模态大语言模型(MLLMs)作为零样本评估器,面临着容易产生幻觉的长篇推理与短篇判断推理能力有限之间的关键矛盾。我们通过一种多维评估-验证奖励(EVR)来解决这些问题。EVR将评估分解为不同的视觉标准;对于每个标准,MLLM评估器生成多个候选假设,验证器将每个主张基于具体的视觉证据进行接受或拒绝,从而产生可靠且细粒度的奖励信号。结合可扩展的数据流水线,我们的方法能够在无需修改架构的情况下对现成编辑器进行强化学习微调。大量实验表明,与基线Qwen-Image-Edit相比有显著提升,一致性和和谐度达到或超越NanoBanana。
查看原文
查看缓存全文

缓存时间: 2026/08/03 05:30

论文页面 - Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

来源:https://huggingface.co/papers/2607.29025

摘要

尽管近期图像编辑模型取得了快速发展,多参考编辑仍具有挑战性,尤其是在不同参考之间保持视觉一致性以及确保整体视觉和谐方面。强化学习已被证明对文本到图像生成和单图像编辑非常有效,但其向多参考编辑的扩展因缺乏能够捕捉多图像关系约束的合适奖励模型而受到阻碍。此外,天真地将多模态大语言模型(MLLMs)用作零样本评估器面临一个关键张力:易出现幻觉的长篇幅推理与短篇幅判断的有限演绎能力之间的矛盾。我们通过多维评估-验证奖励(EVR)来解决这些问题。EVR将评估分解为不同的视觉标准;对于每个标准,一个MLLM评估器生成多个候选假设,一个验证器将每个主张锚定在具体的视觉证据上以接受或拒绝它,从而产生可靠且细粒度的奖励信号。结合可扩展的数据流水线,我们的方法能够在无需架构更改的情况下,对现成编辑器进行强化学习微调。大量实验表明,与基准Qwen-Image-Edit相比有显著提升,其一致性与和谐性达到或超越NanoBanana。

查看 arXiv 页面 (https://arxiv.org/abs/2607.29025) 查看 PDF (https://arxiv.org/pdf/2607.29025) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.29025)

在您的 agent 中获取此论文:

hf papers read 2607\.29025

还没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型

0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.29025,即可从此页面链接到该论文。

引用此论文的数据集

0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.29025,即可从此页面链接到该论文。

引用此论文的 Spaces

0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.29025,即可从此页面链接到该论文。

收录此论文的集合

0

暂无包含此论文的集合

将此论文添加到集合 (https://huggingface.co/new-collection) 即可从此页面链接到该论文。

相似文章

VlogReward:学习面向Vlog编辑的多维度评估

arXiv cs.AI

介绍了VlogReward,一个用于评估Vlog编辑计划在六个维度上的奖励模型,同时附带大规模数据集和基准测试,在与GPT-5和Gemini-3-Pro的对比中取得了最先进的结果。

这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准

Hugging Face Daily Papers

本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。