Artifact-Bench:评估多模态大语言模型在检测与评估AI生成视频伪影方面的能力

Hugging Face Daily Papers 论文

摘要

Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。

近期视频生成模型显著提升了AI生成视频的真实感,但其输出仍存在伪影,如时间不一致性、结构失真和语义不连贯性。尽管多模态大语言模型(MLLMs)展现出强大的视觉理解能力,但它们感知和推理此类伪影的能力尚不清楚。现有基准通常缺乏对伪影感知和细粒度诊断推理的系统评估,尤其是在照片级真实感内容之外的多样化AI生成视频领域。为弥补这一空白,我们引入了Artifact-Bench,这是一个用于评估MLLMs在AI生成视频伪影检测与分析方面能力的综合性基准。我们首先建立了一个三级层次化的真实感伪影分类体系,涵盖照片级真实感、动画和CG风格视频。基于该分类体系,Artifact-Bench定义了三个互补任务:真实视频与AI生成视频分类、成对真实感比较以及细粒度伪影识别。在19个领先的多模态大语言模型上的实验揭示了它们在伪影感知和推理方面的显著局限性,许多模型在具有挑战性的设置中表现接近甚至低于随机水平。我们进一步观察到MLLMs的判断与人类感知偏好之间存在显著错位,突显了它们作为AI生成视频真实感通用评估者的有限可靠性。
查看原文
查看缓存全文

缓存时间: 2026/05/20 02:36

论文页面 - Artifact-Bench:评估多模态大语言模型在AI生成视频伪影检测与评估中的表现

来源:https://huggingface.co/papers/2605.18984 发布日期:5月18日

#1 今日论文 (https://huggingface.co/papers/date/2026-05-20) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Artifact-Bench 评估了多模态大语言模型在检测与分析AI生成视频伪影方面的能力,揭示了这些模型在伪影感知与推理上的显著局限性。

近期视频生成模型大幅提升了AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 的真实感,但其输出仍存在时间不一致、结构扭曲和语义不连贯等伪影。尽管多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)展现出强大的视觉理解 (https://huggingface.co/papers?q=visual%20understanding) 能力,但它们感知和推理此类伪影的能力尚不明确。现有基准缺乏对伪影感知与细粒度诊断推理 (https://huggingface.co/papers?q=diagnostic%20reasoning) 的系统评估,尤其是在超越照片级真实感内容的多样化AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 领域。为填补这一空白,我们引入了 Artifact-Bench,这是一个用于评估MLLMs在AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 伪影检测 (https://huggingface.co/papers?q=artifact%20detection) 与分析方面的综合基准。我们首先建立了一个三级层次化的真实感伪影 (https://huggingface.co/papers?q=realism%20artifacts) 分类体系,涵盖照片级真实感、动画和CG风格视频。基于该分类,Artifact-Bench 定义了三个互补任务:真实视频 vs. AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 分类、成对真实感比较以及细粒度伪影识别 (https://huggingface.co/papers?q=fine-grained%20artifact%20identification)。在19个主流MLLM上的实验揭示了伪影感知与推理的显著局限性,许多模型在困难设置下表现接近随机甚至低于随机水平。我们进一步观察到MLLM的判断与人类感知偏好之间存在显著偏差,凸显了它们作为AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 真实感通用评估者的可靠性有限。

查看arXiv页面 (https://arxiv.org/abs/2605.18984) 查看PDF (https://arxiv.org/pdf/2605.18984) GitHub1 (https://github.com/FrankYang-17/Artifact-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.18984)

在你的智能体中获取这篇论文:

hf papers read 2605\.18984

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

无模型链接该论文

在模型 README.md 中引用 arxiv.org/abs/2605.18984 即可从本页链接。

引用该论文的数据集0

无数据集链接该论文

在数据集 README.md 中引用 arxiv.org/abs/2605.18984 即可从本页链接。

引用该论文的Spaces0

无Space链接该论文

在Space README.md 中引用 arxiv.org/abs/2605.18984 即可从本页链接。

包含该论文的合辑0

无合辑包含该论文

将这篇论文添加到一个合辑 (https://huggingface.co/new-collection) 中即可从本页链接。

相似文章

PerceptionBench:评估多模态大语言模型中的原子视觉感知

Hugging Face Daily Papers

PerceptionBench 是一个基准测试,旨在评估多模态大语言模型(MLLMs)的原子视觉感知能力,采用了由十种原子感知能力组成的自底向上分类法。对16个前沿MLLM的测试结果显示,没有任何模型达到60%的准确率,表明视觉感知问题在很大程度上仍未解决。

ArtECulture:多模态大语言模型中文化条件视觉情感理解的基准测试

arXiv cs.CL

本文介绍了ArtECulture,这是一个用于多模态大语言模型中文化条件视觉情感理解的基准测试,涵盖英语、中文和阿拉伯文化,并包含均衡的西方和非西方艺术作品。评估表明该任务仍具挑战性,作者提出了一种检索增强框架,将文化知识注入多模态大语言模型(MLLMs)。

空中MLLM智能体的零样本任务级评估

arXiv cs.CL

MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。