MSAVBench:迈向多镜头音视频生成的全面可靠评估

Hugging Face Daily Papers 论文

摘要

MSAVBench是首个面向多镜头音视频生成的综合基准与自适应评估框架,评估了19个模型在多样化任务上的表现,并与人类判断实现了高度对齐。

视频生成正从单镜头合成迅速演变为复杂的多镜头音视频(MSAV)叙事,以满足现实世界的需求。然而,评估这类前沿模型仍是一个基本挑战。现有基准在范围和多样性上有限,且依赖僵化的评估流程,阻碍了对现代MSAV模型的系统可靠评估。为弥补这些差距,我们提出了MSAVBench,这是首个面向多镜头音视频生成的综合基准与自适应混合评估框架。我们的基准涵盖四个关键维度:视频、音频、镜头和参考,覆盖多样化的任务设置、最多15个镜头的不同数量以及具有挑战性的非真实场景。我们的评估框架通过镜头分割的自适应自校正机制、主观指标的实例级评分规则以及复杂判断的基于工具的凭证提取,提高了鲁棒性。此外,MSAVBench与人类判断实现了高度对齐,斯皮尔曼等级相关系数达到91.5%。我们对19个最先进的闭源和开源模型进行了系统评估,结果显示当前系统在导演级控制和细粒度音视频同步方面仍然困难重重,而模块化或代理式生成管线为缩小开源与闭源模型之间的差距提供了一条有前景的路径。我们将发布基准数据和评估代码以促进未来研究。
查看原文
查看缓存全文

缓存时间: 2026/05/20 06:37

论文页面 - MSAVBench: 迈向多镜头音频-视频生成的全面与可靠评估

来源: https://huggingface.co/papers/2605.20183 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

MSAVBench 提出了首个用于多镜头音频-视频生成的全面基准测试与自适应评估框架,通过多样化的任务设置和先进评估机制,解决了现有基准的局限性。

视频生成正从单镜头合成迅速演变为复杂的多镜头音频-视频(MSAV)叙事,以满足现实世界的需求。然而,评估这些前沿模型仍是一项根本性挑战。现有基准在范围和数据多样性上有限,并依赖僵化的评估流程,阻碍了对现代 MSAV 模型的系统性和可靠评估。为弥补这些差距,我们引入了 MSAVBench——首个面向多镜头音频-视频生成的全面基准测试与自适应混合评估框架。我们的基准涵盖四个关键维度:视频、音频、镜头和参考,涉及多样化的任务设置、最多 15 个镜头数量的变化以及具有挑战性的非现实场景。我们的评估框架通过镜头分割的自适应自我修正机制、主观指标的逐实例评分标准,以及用于复杂判断的工具化证据提取,提升了鲁棒性。此外,MSAVBench 与人类判断高度一致,达到了 91.5% 的斯皮尔曼秩相关系数。我们对 19 个最先进的闭源和开源模型进行系统评估后发现,当前系统在导演级控制与细粒度音视频同步方面仍存在困难,而模块化或智能体生成流程则为实现开源模型与闭源模型之间差距的缩小提供了一条有前景的路径。我们将发布基准数据和评估代码,以推动未来研究。

查看 arXiv 页面 (https://arxiv.org/abs/2605.20183)查看 PDF (https://arxiv.org/pdf/2605.20183)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.20183)

在您的 agent 中获取这篇论文:

hf papers read 2605\.20183

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.20183 以在此页面链接。

引用此论文的数据集0

暂无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.20183 以在此页面链接。

引用此论文的 Space0

暂无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.20183 以在此页面链接。

包含此论文的收藏0

暂无收藏包含此论文

请将此论文添加到一个收藏 (https://huggingface.co/new-collection) 以在此页面链接。

相似文章

@samsja19:很棒的基准

X AI KOLs Following

介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。