OmniVBench:一个用于全能参考视频生成的基准和大规模数据集
摘要
本文介绍了OmniVBench,一个用于全能参考视频生成的综合基准,以及Omni-R2VDataset,一个大规模训练数据集,以评估和改进R2V模型。
查看缓存全文
缓存时间: 2026/09/21 03:20
论文页面 - OmniVBench:面向全模态参考到视频生成的基准测试与大规模数据集
来源:https://huggingface.co/papers/2609.22069 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
参考到视频(R2V)生成正朝着日益通用和多样的参考控制方向发展,催生了新兴的全模态R2V生成范式。然而,现有基准测试未能充分评估这些新兴能力:其测试用例涵盖的参考类型和组合有限,且评估协议主要评估整体参考一致性,忽略了参考因素是否被正确保留、解耦和分配。与此同时,构建全模态R2V训练数据的高成本导致合适的训练资源稀缺。为弥补这些不足,我们推出了OmniVBench和Omni-R2V数据集,用于评估和训练全模态R2V模型。OmniVBench将R2V评估扩展到更广泛的参考类型、细粒度控制任务和更丰富的参考组合中,涵盖7个任务族和18个细粒度任务,横跨内容、运动、风格、结构、叙事及多参考场景。我们引入基于因素的评估,包含12,172个案例特定的检查项,评估预期参考因素是否被忠实保留、正确解耦并绑定到其目标,以及是否根据指令被恰当实现。我们进一步推出Omni-R2V数据集,为广泛的R2V任务提供工业级训练资源。该数据集主要基于大规模专业视频素材构建,包含340,000个处理过的训练样本,涵盖多样参考类型和多参考组合。我们开发了针对参考-目标对构建的特定任务流程,为全模态R2V数据构建提供了实用且可扩展的方案。对先进的开源和闭源R2V模型进行的广泛评估显示,它们在OmniVBench上的任务族和评估维度上存在显著性能差距,凸显了当前R2V模型的现有局限性。
查看arXiv页面(https://arxiv.org/abs/2609.22069)查看PDF(https://arxiv.org/pdf/2609.22069)项目页面(https://wxliii.github.io/OmniVBench/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.22069)
在您的代理中获取此论文:
hf papers read 2609.22069
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.22069以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.22069以从本页面链接。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2609.22069以从本页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接。
相似文章
OmniPro:面向全主动流式视频理解的综合基准
OmniPro 是首个用于评估全模态大语言模型中主动流式视频理解的基准,包含 2,700 个样本,覆盖多种任务和双模式评估协议。
OmniVideo-100K:一个通过结构化脚本和证据链进行音视频推理的数据集
OmniVideo-100K介绍了一个自动化的数据引擎,通过实体锚定脚本和线索引导的问答生成来提升音视频推理和时间一致性,在多个基准测试上实现了显著的性能提升。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
OmniAssistBench: 针对全能大语言模型的助理式交互基准测试
OmniAssistBench 是一个用于评估作为实时视频助理的全能大语言模型的基准测试,揭示当前模型在视觉提示、上下文保持和及时响应方面存在困难。
超大视频推理套件
本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。