Edit-Compass & EditReward-Compass: 图像编辑与奖励建模的统一基准
摘要
介绍了Edit-Compass和EditReward-Compass,这是一个用于评估图像编辑模型和奖励模型的统一基准套件,包含2,388个标注实例和2,251个偏好对,用于真实的强化学习场景。
查看缓存全文
缓存时间: 2026/05/14 04:17
论文页面 - Edit-Compass & EditReward-Compass: 图像编辑与奖励建模的统一基准
来源:https://huggingface.co/papers/2605.13062
摘要
近年来,图像编辑模型在指令遵循、多模态理解和复杂视觉编辑方面取得了显著进展。然而,现有基准测试往往无法真实反映人类判断,尤其是对于强大的前沿模型,原因在于任务难度有限和评估协议粒度粗糙。与此同时,基于强化学习的图像编辑优化中,奖励模型变得越来越重要,但现有的奖励模型基准测试仍依赖于不切实际的评估设置,与实际的强化学习场景脱节。这些局限性阻碍了对图像编辑模型和奖励模型的可靠评估。为解决这些挑战,我们引入了 Edit-Compass 和 EditReward-Compass,这是一个用于图像编辑和奖励建模的统一评估套件。Edit-Compass 包含 2,388 个精心标注的实例,涵盖六个任务难度逐步递增的类别,涉及世界知识推理、视觉推理和多图像编辑等能力。除了广泛的任务覆盖,Edit-Compass 还采用了一个基于结构化推理和精心设计评分细则的细粒度多维评估框架。同时,EditReward-Compass 包含 2,251 个模拟强化学习优化过程中真实奖励建模场景的偏好对。
近年来图像编辑模型 (https://huggingface.co/papers?q=image%20editing%20models) 在指令遵循、多模态理解和复杂视觉编辑方面取得了显著进展。然而,现有基准测试往往无法真实反映人类判断,尤其是对于强大的前沿模型,原因在于任务难度有限和评估协议粒度粗糙 (https://huggingface.co/papers?q=evaluation%20protocols)。与此同时,奖励模型 (https://huggingface.co/papers?q=reward%20models) 在基于强化学习的图像编辑优化中变得越来越重要,但现有的奖励模型基准测试仍依赖于不切实际的评估设置,与实际的强化学习场景脱节。这些局限性阻碍了对图像编辑模型 (https://huggingface.co/papers?q=image%20editing%20models) 和奖励模型 (https://huggingface.co/papers?q=reward%20models) 的可靠评估。为解决这些挑战,我们引入了 Edit-Compass 和 EditReward-Compass,这是一个用于图像编辑和奖励建模的统一评估套件。Edit-Compass 包含 2,388 个精心标注的实例,涵盖六个任务难度逐步递增的类别,涉及世界知识推理、视觉推理和多图像编辑等能力。除了广泛的任务覆盖,Edit-Compass 还采用了一个基于结构化推理 (https://huggingface.co/papers?q=structured%20reasoning) 和精心设计评分细则 (https://huggingface.co/papers?q=scoring%20rubrics) 的细粒度多维评估框架。同时,EditReward-Compass 包含 2,251 个偏好对 (https://huggingface.co/papers?q=preference%20pairs),模拟强化学习优化中的真实奖励建模场景 (https://huggingface.co/papers?q=reward%20modeling%20scenarios)。
查看 arXiv 页面 (https://arxiv.org/abs/2605.13062) 查看 PDF (https://arxiv.org/pdf/2605.13062) GitHub4 (https://github.com/bxhsort/Edit-Compass-and-EditReward-Compass) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13062)
在您的代理中获取此论文:
hf papers read 2605\.13062
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无关联此论文的模型
请在模型 README.md 中引用 arxiv.org/abs/2605.13062 以将其链接至此页面。
引用此论文的数据集0
无关联此论文的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2605.13062 以将其链接至此页面。
引用此论文的 Space0
无关联此论文的 Space
请在 Space README.md 中引用 arxiv.org/abs/2605.13062 以将其链接至此页面。
包含此论文的收藏集0
无包含此论文的收藏集
请将本论文添加至收藏集 (https://huggingface.co/new-collection) 以将其链接至此页面。
相似文章
这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准
本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。
HP-Edit:面向图像编辑的人类偏好后训练框架
HP-Edit 提出一种后训练框架,通过 RLHF 将基于扩散的图像编辑模型与人类偏好对齐,依托全新 5 万张真实场景数据集及自动 VLM 评估器。
一致性多参考图像编辑的评估-验证奖励
本文提出一种多维评估-验证奖励(EVR),用于多参考图像编辑模型的强化学习微调,提升视觉一致性与和谐度。
AVE-Compass:迈向音视频编辑能力的全面评估
AVE-Compass 是一个用于全面评估音视频编辑能力的新基准,包含 145 个视频、196 条编辑指令和 2,688 个检查表项。它还提出了 AVE-Agent,一个模块化智能体框架,通过自我反思和评估器反馈改进跨模态编辑。
PaintBench: 精确视觉编辑的确定性评估
PaintBench是一个新的基准,用于评估多模态模型中的精确视觉编辑,涵盖4个类别中的20种操作,采用确定性像素级评估。测试11个模型显示整体性能较低,最佳模型仅获得17.1%的mIoU。