Artifact-Bench:评估多模态大语言模型在检测与评估AI生成视频伪影方面的能力
摘要
Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。
查看缓存全文
缓存时间: 2026/05/20 02:36
论文页面 - Artifact-Bench:评估多模态大语言模型在AI生成视频伪影检测与评估中的表现
来源:https://huggingface.co/papers/2605.18984 发布日期:5月18日
#1 今日论文 (https://huggingface.co/papers/date/2026-05-20) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Artifact-Bench 评估了多模态大语言模型在检测与分析AI生成视频伪影方面的能力,揭示了这些模型在伪影感知与推理上的显著局限性。
近期视频生成模型大幅提升了AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 的真实感,但其输出仍存在时间不一致、结构扭曲和语义不连贯等伪影。尽管多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)展现出强大的视觉理解 (https://huggingface.co/papers?q=visual%20understanding) 能力,但它们感知和推理此类伪影的能力尚不明确。现有基准缺乏对伪影感知与细粒度诊断推理 (https://huggingface.co/papers?q=diagnostic%20reasoning) 的系统评估,尤其是在超越照片级真实感内容的多样化AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 领域。为填补这一空白,我们引入了 Artifact-Bench,这是一个用于评估MLLMs在AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 伪影检测 (https://huggingface.co/papers?q=artifact%20detection) 与分析方面的综合基准。我们首先建立了一个三级层次化的真实感伪影 (https://huggingface.co/papers?q=realism%20artifacts) 分类体系,涵盖照片级真实感、动画和CG风格视频。基于该分类,Artifact-Bench 定义了三个互补任务:真实视频 vs. AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 分类、成对真实感比较以及细粒度伪影识别 (https://huggingface.co/papers?q=fine-grained%20artifact%20identification)。在19个主流MLLM上的实验揭示了伪影感知与推理的显著局限性,许多模型在困难设置下表现接近随机甚至低于随机水平。我们进一步观察到MLLM的判断与人类感知偏好之间存在显著偏差,凸显了它们作为AI生成视频 (https://huggingface.co/papers?q=AI-generated%20video) 真实感通用评估者的可靠性有限。
查看arXiv页面 (https://arxiv.org/abs/2605.18984) 查看PDF (https://arxiv.org/pdf/2605.18984) GitHub1 (https://github.com/FrankYang-17/Artifact-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.18984)
在你的智能体中获取这篇论文:
hf papers read 2605\.18984
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
无模型链接该论文
在模型 README.md 中引用 arxiv.org/abs/2605.18984 即可从本页链接。
引用该论文的数据集0
无数据集链接该论文
在数据集 README.md 中引用 arxiv.org/abs/2605.18984 即可从本页链接。
引用该论文的Spaces0
无Space链接该论文
在Space README.md 中引用 arxiv.org/abs/2605.18984 即可从本页链接。
包含该论文的合辑0
无合辑包含该论文
将这篇论文添加到一个合辑 (https://huggingface.co/new-collection) 中即可从本页链接。
相似文章
MuseBench: 对多模态大语言模型中意图层面视听艺术理解的基准评估
MuseBench是一个全面基准,旨在评估多模态大语言模型对视听艺术中细微意图层面的理解,结果显示即使最佳模型也仅达到48.29%的准确率,而人类专家为87.18%。
MLS-Bench:对 AI 系统在构建更优 AI 方面能力的全面与严格评估
本文介绍了 MLS-Bench,这是一个旨在评估 AI 系统能否发明具有通用性和可扩展性的机器学习方法,而非仅仅进行工程调优的基准测试。
PerceptionBench:评估多模态大语言模型中的原子视觉感知
PerceptionBench 是一个基准测试,旨在评估多模态大语言模型(MLLMs)的原子视觉感知能力,采用了由十种原子感知能力组成的自底向上分类法。对16个前沿MLLM的测试结果显示,没有任何模型达到60%的准确率,表明视觉感知问题在很大程度上仍未解决。
ArtECulture:多模态大语言模型中文化条件视觉情感理解的基准测试
本文介绍了ArtECulture,这是一个用于多模态大语言模型中文化条件视觉情感理解的基准测试,涵盖英语、中文和阿拉伯文化,并包含均衡的西方和非西方艺术作品。评估表明该任务仍具挑战性,作者提出了一种检索增强框架,将文化知识注入多模态大语言模型(MLLMs)。
空中MLLM智能体的零样本任务级评估
MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。