PaintBench: 精确视觉编辑的确定性评估
摘要
PaintBench是一个新的基准,用于评估多模态模型中的精确视觉编辑,涵盖4个类别中的20种操作,采用确定性像素级评估。测试11个模型显示整体性能较低,最佳模型仅获得17.1%的mIoU。
尽管当前的多模态模型在开放式视觉编辑方面表现出色,但执行精确的单答案编辑仍然是一个重要障碍。为了探究这一挑战,我们引入了PaintBench,这是一个动态可扩展的基准,针对四个类别中的20种基本精确视觉编辑操作:几何变换、结构操作、颜色变化和符号推理。通过可配置复杂度的程序化生成,可以实现几乎无限且抗污染的评估套件,而确定性像素级评估则消除了对易有偏见的评判模型的依赖。在对11个图像编辑模型的测试中,我们发现整体性能较低,当前性能最高的行业领先者仅获得17.1%(mIoU)。任务分解揭示了特别具有挑战性的操作类型(几何变换、大多数结构操作、基于公式的颜色变化)以及模型特定的专长。细粒度基准诊断进一步显示了由对象数量、背景复杂度、配色方案和编辑区域大小等场景变化导致的性能下降。为了测试PaintBench分数在应用任务性能上的泛化能力,我们创建了一个用于数据可视化编辑的程序化确定性评估(TinyGrafixBench),并发现其与PaintBench分数存在强线性相关性(R² = 0.91, p < 0.001)。总之,PaintBench为衡量和推动精确多模态视觉编辑的进展提供了严格的基础。
相似文章
CPI-Bench:一个全面、实用且智能的真实世界图像编辑基准
CPI-Bench 是一个针对真实世界图像编辑的全面基准,评估多图像任务、实际应用和基于推理的编辑,以更好地区分模型性能。
MPIE-Bench:面向解剖学合理的多人交互编辑的基准测试
介绍了MPIE-Bench——一个包含2,500个样本的多人交互图像编辑基准,以及MPIE-Eval,一种基于网格的评估方法,在十个编辑器中比VLM检查表更贴近人类判断。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。
这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准
本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。
MuseBench: 对多模态大语言模型中意图层面视听艺术理解的基准评估
MuseBench是一个全面基准,旨在评估多模态大语言模型对视听艺术中细微意图层面的理解,结果显示即使最佳模型也仅达到48.29%的准确率,而人类专家为87.18%。