Edit-Compass & EditReward-Compass: 图像编辑与奖励建模的统一基准

Hugging Face Daily Papers 论文

摘要

介绍了Edit-Compass和EditReward-Compass,这是一个用于评估图像编辑模型和奖励模型的统一基准套件,包含2,388个标注实例和2,251个偏好对,用于真实的强化学习场景。

最近的图像编辑模型在指令跟随、多模态理解和复杂视觉编辑方面取得了显著进展。然而,现有的基准测试由于任务难度有限和评估粒度粗糙,往往无法忠实反映人类判断,尤其是对于强大的前沿模型。与此同时,奖励模型对于基于强化学习的图像编辑优化变得越来越重要,但现有的奖励模型基准测试仍然依赖于偏离实际强化学习场景的非现实评估设置。这些限制阻碍了对图像编辑模型和奖励模型的可靠评估。为了解决这些挑战,我们提出了Edit-Compass和EditReward-Compass,这是一个用于图像编辑和奖励建模的统一评估套件。Edit-Compass包含2,388个精心标注的实例,涵盖六个逐步增加难度的任务类别,包括世界知识推理、视觉推理和多图像编辑等能力。除了广泛的任务覆盖,Edit-Compass还采用了基于结构化推理和精心设计的评分标准的细粒度多维评估框架。与此同时,EditReward-Compass包含2,251个偏好对,模拟了强化学习优化过程中真实的奖励建模场景。
查看原文
查看缓存全文

缓存时间: 2026/05/14 04:17

论文页面 - Edit-Compass & EditReward-Compass: 图像编辑与奖励建模的统一基准

来源:https://huggingface.co/papers/2605.13062

摘要

近年来,图像编辑模型在指令遵循、多模态理解和复杂视觉编辑方面取得了显著进展。然而,现有基准测试往往无法真实反映人类判断,尤其是对于强大的前沿模型,原因在于任务难度有限和评估协议粒度粗糙。与此同时,基于强化学习的图像编辑优化中,奖励模型变得越来越重要,但现有的奖励模型基准测试仍依赖于不切实际的评估设置,与实际的强化学习场景脱节。这些局限性阻碍了对图像编辑模型和奖励模型的可靠评估。为解决这些挑战,我们引入了 Edit-Compass 和 EditReward-Compass,这是一个用于图像编辑和奖励建模的统一评估套件。Edit-Compass 包含 2,388 个精心标注的实例,涵盖六个任务难度逐步递增的类别,涉及世界知识推理、视觉推理和多图像编辑等能力。除了广泛的任务覆盖,Edit-Compass 还采用了一个基于结构化推理和精心设计评分细则的细粒度多维评估框架。同时,EditReward-Compass 包含 2,251 个模拟强化学习优化过程中真实奖励建模场景的偏好对。

近年来图像编辑模型 (https://huggingface.co/papers?q=image%20editing%20models) 在指令遵循、多模态理解和复杂视觉编辑方面取得了显著进展。然而,现有基准测试往往无法真实反映人类判断,尤其是对于强大的前沿模型,原因在于任务难度有限和评估协议粒度粗糙 (https://huggingface.co/papers?q=evaluation%20protocols)。与此同时,奖励模型 (https://huggingface.co/papers?q=reward%20models) 在基于强化学习的图像编辑优化中变得越来越重要,但现有的奖励模型基准测试仍依赖于不切实际的评估设置,与实际的强化学习场景脱节。这些局限性阻碍了对图像编辑模型 (https://huggingface.co/papers?q=image%20editing%20models) 和奖励模型 (https://huggingface.co/papers?q=reward%20models) 的可靠评估。为解决这些挑战,我们引入了 Edit-Compass 和 EditReward-Compass,这是一个用于图像编辑和奖励建模的统一评估套件。Edit-Compass 包含 2,388 个精心标注的实例,涵盖六个任务难度逐步递增的类别,涉及世界知识推理、视觉推理和多图像编辑等能力。除了广泛的任务覆盖,Edit-Compass 还采用了一个基于结构化推理 (https://huggingface.co/papers?q=structured%20reasoning) 和精心设计评分细则 (https://huggingface.co/papers?q=scoring%20rubrics) 的细粒度多维评估框架。同时,EditReward-Compass 包含 2,251 个偏好对 (https://huggingface.co/papers?q=preference%20pairs),模拟强化学习优化中的真实奖励建模场景 (https://huggingface.co/papers?q=reward%20modeling%20scenarios)。

查看 arXiv 页面 (https://arxiv.org/abs/2605.13062) 查看 PDF (https://arxiv.org/pdf/2605.13062) GitHub4 (https://github.com/bxhsort/Edit-Compass-and-EditReward-Compass) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13062)

在您的代理中获取此论文:

hf papers read 2605\.13062

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无关联此论文的模型

请在模型 README.md 中引用 arxiv.org/abs/2605.13062 以将其链接至此页面。

引用此论文的数据集0

无关联此论文的数据集

请在数据集 README.md 中引用 arxiv.org/abs/2605.13062 以将其链接至此页面。

引用此论文的 Space0

无关联此论文的 Space

请在 Space README.md 中引用 arxiv.org/abs/2605.13062 以将其链接至此页面。

包含此论文的收藏集0

无包含此论文的收藏集

请将本论文添加至收藏集 (https://huggingface.co/new-collection) 以将其链接至此页面。

相似文章

这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准

Hugging Face Daily Papers

本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。

AVE-Compass:迈向音视频编辑能力的全面评估

Hugging Face Daily Papers

AVE-Compass 是一个用于全面评估音视频编辑能力的新基准,包含 145 个视频、196 条编辑指令和 2,688 个检查表项。它还提出了 AVE-Agent,一个模块化智能体框架,通过自我反思和评估器反馈改进跨模态编辑。

PaintBench: 精确视觉编辑的确定性评估

Hugging Face Daily Papers

PaintBench是一个新的基准,用于评估多模态模型中的精确视觉编辑,涵盖4个类别中的20种操作,采用确定性像素级评估。测试11个模型显示整体性能较低,最佳模型仅获得17.1%的mIoU。