一致性多参考图像编辑的评估-验证奖励
摘要
本文提出一种多维评估-验证奖励(EVR),用于多参考图像编辑模型的强化学习微调,提升视觉一致性与和谐度。
查看缓存全文
缓存时间: 2026/08/03 05:30
论文页面 - Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
来源:https://huggingface.co/papers/2607.29025
摘要
尽管近期图像编辑模型取得了快速发展,多参考编辑仍具有挑战性,尤其是在不同参考之间保持视觉一致性以及确保整体视觉和谐方面。强化学习已被证明对文本到图像生成和单图像编辑非常有效,但其向多参考编辑的扩展因缺乏能够捕捉多图像关系约束的合适奖励模型而受到阻碍。此外,天真地将多模态大语言模型(MLLMs)用作零样本评估器面临一个关键张力:易出现幻觉的长篇幅推理与短篇幅判断的有限演绎能力之间的矛盾。我们通过多维评估-验证奖励(EVR)来解决这些问题。EVR将评估分解为不同的视觉标准;对于每个标准,一个MLLM评估器生成多个候选假设,一个验证器将每个主张锚定在具体的视觉证据上以接受或拒绝它,从而产生可靠且细粒度的奖励信号。结合可扩展的数据流水线,我们的方法能够在无需架构更改的情况下,对现成编辑器进行强化学习微调。大量实验表明,与基准Qwen-Image-Edit相比有显著提升,其一致性与和谐性达到或超越NanoBanana。
查看 arXiv 页面 (https://arxiv.org/abs/2607.29025) 查看 PDF (https://arxiv.org/pdf/2607.29025) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.29025)
在您的 agent 中获取此论文:
hf papers read 2607\.29025
还没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型
0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.29025,即可从此页面链接到该论文。
引用此论文的数据集
0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.29025,即可从此页面链接到该论文。
引用此论文的 Spaces
0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.29025,即可从此页面链接到该论文。
收录此论文的集合
0
暂无包含此论文的集合
将此论文添加到集合 (https://huggingface.co/new-collection) 即可从此页面链接到该论文。
相似文章
Edit-Compass & EditReward-Compass: 图像编辑与奖励建模的统一基准
介绍了Edit-Compass和EditReward-Compass,这是一个用于评估图像编辑模型和奖励模型的统一基准套件,包含2,388个标注实例和2,251个偏好对,用于真实的强化学习场景。
VlogReward:学习面向Vlog编辑的多维度评估
介绍了VlogReward,一个用于评估Vlog编辑计划在六个维度上的奖励模型,同时附带大规模数据集和基准测试,在与GPT-5和Gemini-3-Pro的对比中取得了最先进的结果。
这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准
本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。
DeltaRubric:通过联合规划与验证实现生成式多模态奖励建模
DeltaRubric 是一篇研究论文,介绍了一种使用单一多模态大语言模型(MLLM)的两步多模态偏好评估方法,通过联合规划与验证来提高奖励建模的可靠性。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。