MPIE-Bench:面向解剖学合理的多人交互编辑的基准测试

Hugging Face Daily Papers 论文

摘要

介绍了MPIE-Bench——一个包含2,500个样本的多人交互图像编辑基准,以及MPIE-Eval,一种基于网格的评估方法,在十个编辑器中比VLM检查表更贴近人类判断。

文本到图像和个性化编辑模型现在可以轻松合成高保真度的单主体图像。然而,将多个命名人物置于共享接触动作(如拥抱、背负或扭打)中仍然暴露了重大缺陷:肢体融合、产生多余的肢体以及身体相互穿透。现有评估大多忽略了这些解剖学和几何问题,而VLM作为评判者的检查表在交互性上常常达到饱和,但这些错误对人类来说依然显而易见。我们推出了MPIE-Bench,一个包含2,500个样本的视频挖掘编辑三元组基准,涵盖405个场景、14个交互类别和四种接触密度(C0-C3)。我们还提出了MPIE-Eval,其两个新指标从冻结的公开多人网格重建中评估接触时的几何形状。解剖学(Anatomy)检查每个人形质量是否由一组完整的重建身体所解释,交互性(Interaction)检查这些身体之间的穿透和表面距离是否与指令要求的接触相匹配。在十个编辑器中,网格解剖学在两个不同模型上的最高得分为0.65,网格交互性最高为0.72,因此没有单一编辑器在两者上都表现强劲,而VLM检查表对相同图像的评分超过0.95。一项五名评估者的研究证实,这两个指标都比零样本VLM评判者更贴近人类判断,并且在去除所有权重和阈值的情况下排名仍然成立。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:52

论文页面 - MPIE-Bench:解剖学上合理的多人交互编辑基准测试

摘要

文本到图像以及个性化编辑模型现在可以轻松合成高保真度的单主体图像。然而,将多个具名人物置于共享接触动作(如拥抱、背负或扭打)中仍会暴露出重大缺陷:肢体融合、虚构的四肢以及身体相互穿透。现有评估大多忽视了这些解剖学和几何问题,而基于VLM的裁判清单在交互(Interaction)维度上往往趋于饱和,但错误对人类来说仍然显而易见。我们提出了MPIE-Bench,一个包含2,500个样本、从视频中挖掘的编辑三元组基准,涵盖405个场景、14个交互类别和四种接触密度(C0-C3)。我们还提出了MPIE-Eval,其两个新轴通过冻结的公开多人网格重建来评分接触时的几何结构。Anatomy(解剖学)检查每个人形质量是否都能由一组完整的重建身体来解释,Interaction(交互)检查这些身体之间的穿透距离和表面距离是否与指令所要求的接触相匹配。在十个编辑器上,网格Anatomy在两个不同模型上最高达到0.65,网格Interaction最高达到0.72,因此没有一个编辑器在两个方面都很强,而VLM清单对相同图像的评分超过0.95。一项五名评分者的研究证实,这两个轴都比零样本VLM裁判更贴近人类判断,并且在消融所有权重和阈值后排名仍然成立。

查看 arXiv 页面 (https://arxiv.org/abs/2607.27616)查看 PDF (https://arxiv.org/pdf/2607.27616)GitHub1 (https://github.com/AnnLin0628/mpie-bench)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.27616)

在您的代理中获取此论文:

hf papers read 2607\.27616

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.27616,以从此页面链接它。

引用此论文的数据集0

没有数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.27616,以从此页面链接它。

引用此论文的 Space0

没有 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.27616,以从此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

PaintBench: 精确视觉编辑的确定性评估

Hugging Face Daily Papers

PaintBench是一个新的基准,用于评估多模态模型中的精确视觉编辑,涵盖4个类别中的20种操作,采用确定性像素级评估。测试11个模型显示整体性能较低,最佳模型仅获得17.1%的mIoU。

MemoBench:动态变化环境中世界建模的基准测试

Hugging Face Daily Papers

MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。

这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准

Hugging Face Daily Papers

本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。