MSAVBench:迈向多镜头音视频生成的全面可靠评估
摘要
MSAVBench是首个面向多镜头音视频生成的综合基准与自适应评估框架,评估了19个模型在多样化任务上的表现,并与人类判断实现了高度对齐。
查看缓存全文
缓存时间: 2026/05/20 06:37
论文页面 - MSAVBench: 迈向多镜头音频-视频生成的全面与可靠评估
来源: https://huggingface.co/papers/2605.20183 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
MSAVBench 提出了首个用于多镜头音频-视频生成的全面基准测试与自适应评估框架,通过多样化的任务设置和先进评估机制,解决了现有基准的局限性。
视频生成正从单镜头合成迅速演变为复杂的多镜头音频-视频(MSAV)叙事,以满足现实世界的需求。然而,评估这些前沿模型仍是一项根本性挑战。现有基准在范围和数据多样性上有限,并依赖僵化的评估流程,阻碍了对现代 MSAV 模型的系统性和可靠评估。为弥补这些差距,我们引入了 MSAVBench——首个面向多镜头音频-视频生成的全面基准测试与自适应混合评估框架。我们的基准涵盖四个关键维度:视频、音频、镜头和参考,涉及多样化的任务设置、最多 15 个镜头数量的变化以及具有挑战性的非现实场景。我们的评估框架通过镜头分割的自适应自我修正机制、主观指标的逐实例评分标准,以及用于复杂判断的工具化证据提取,提升了鲁棒性。此外,MSAVBench 与人类判断高度一致,达到了 91.5% 的斯皮尔曼秩相关系数。我们对 19 个最先进的闭源和开源模型进行系统评估后发现,当前系统在导演级控制与细粒度音视频同步方面仍存在困难,而模块化或智能体生成流程则为实现开源模型与闭源模型之间差距的缩小提供了一条有前景的路径。我们将发布基准数据和评估代码,以推动未来研究。
查看 arXiv 页面 (https://arxiv.org/abs/2605.20183)查看 PDF (https://arxiv.org/pdf/2605.20183)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.20183)
在您的 agent 中获取这篇论文:
hf papers read 2605\.20183
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.20183 以在此页面链接。
引用此论文的数据集0
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.20183 以在此页面链接。
引用此论文的 Space0
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.20183 以在此页面链接。
包含此论文的收藏0
暂无收藏包含此论文
请将此论文添加到一个收藏 (https://huggingface.co/new-collection) 以在此页面链接。
相似文章
MultiRef-Compass: 迈向多参考到音频视频生成的全面评估
本文介绍了MultiRef-Compass,这是针对多参考到音频视频生成的全面基准,包含350个精心挑选的样本和评估协议,涵盖四个维度:基础质量、参考一致性、音视频一致性和指令遵循。
LongAV-Compass:面向分钟级音视频生成在T2AV、I2AV和V2AV上的统一评估
LongAV-Compass是一个综合基准,用于评估分钟级音视频生成在文本、图像和视频条件模态下的表现,衡量长时间序列上的质量、一致性和对齐程度。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
@samsja19:很棒的基准
介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。