MPIE-Bench:面向解剖学合理的多人交互编辑的基准测试
摘要
介绍了MPIE-Bench——一个包含2,500个样本的多人交互图像编辑基准,以及MPIE-Eval,一种基于网格的评估方法,在十个编辑器中比VLM检查表更贴近人类判断。
查看缓存全文
缓存时间: 2026/07/31 05:52
论文页面 - MPIE-Bench:解剖学上合理的多人交互编辑基准测试
摘要
文本到图像以及个性化编辑模型现在可以轻松合成高保真度的单主体图像。然而,将多个具名人物置于共享接触动作(如拥抱、背负或扭打)中仍会暴露出重大缺陷:肢体融合、虚构的四肢以及身体相互穿透。现有评估大多忽视了这些解剖学和几何问题,而基于VLM的裁判清单在交互(Interaction)维度上往往趋于饱和,但错误对人类来说仍然显而易见。我们提出了MPIE-Bench,一个包含2,500个样本、从视频中挖掘的编辑三元组基准,涵盖405个场景、14个交互类别和四种接触密度(C0-C3)。我们还提出了MPIE-Eval,其两个新轴通过冻结的公开多人网格重建来评分接触时的几何结构。Anatomy(解剖学)检查每个人形质量是否都能由一组完整的重建身体来解释,Interaction(交互)检查这些身体之间的穿透距离和表面距离是否与指令所要求的接触相匹配。在十个编辑器上,网格Anatomy在两个不同模型上最高达到0.65,网格Interaction最高达到0.72,因此没有一个编辑器在两个方面都很强,而VLM清单对相同图像的评分超过0.95。一项五名评分者的研究证实,这两个轴都比零样本VLM裁判更贴近人类判断,并且在消融所有权重和阈值后排名仍然成立。
查看 arXiv 页面 (https://arxiv.org/abs/2607.27616)查看 PDF (https://arxiv.org/pdf/2607.27616)GitHub1 (https://github.com/AnnLin0628/mpie-bench)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.27616)
在您的代理中获取此论文:
hf papers read 2607\.27616
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.27616,以从此页面链接它。
引用此论文的数据集0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.27616,以从此页面链接它。
引用此论文的 Space0
没有 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.27616,以从此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
CPI-Bench:一个全面、实用且智能的真实世界图像编辑基准
CPI-Bench 是一个针对真实世界图像编辑的全面基准,评估多图像任务、实际应用和基于推理的编辑,以更好地区分模型性能。
PaintBench: 精确视觉编辑的确定性评估
PaintBench是一个新的基准,用于评估多模态模型中的精确视觉编辑,涵盖4个类别中的20种操作,采用确定性像素级评估。测试11个模型显示整体性能较低,最佳模型仅获得17.1%的mIoU。
MemoBench:动态变化环境中世界建模的基准测试
MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。
这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准
本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。