OmniVBench:一个用于全能参考视频生成的基准和大规模数据集

Hugging Face Daily Papers 论文

摘要

本文介绍了OmniVBench,一个用于全能参考视频生成的综合基准,以及Omni-R2VDataset,一个大规模训练数据集,以评估和改进R2V模型。

参考视频(R2V)生成正朝着越来越通用和多样的参考控制方向发展,催生了全能R2V生成这一新兴范式。然而,现有基准未能满足这些新兴能力:它们的测试用例覆盖的参考类型和组合有限,评估协议主要评估整体参考一致性,忽略了参考因素是否被正确保留、解离和路由。同时,构建全能R2V训练数据的高成本使得合适的训练资源稀缺。为了解决这些差距,我们介绍了OmniVBench和Omni-R2VDataset,用于评估和训练全能R2V模型。OmniVBench扩展了R2V评估,涵盖更广泛的参考类型、细粒度控制任务和更丰富的参考组合,覆盖7个任务族和18个细粒度任务,包括内容、运动、风格、结构、叙事和多参考设置。我们引入了基于因素的评估,包含12,172个案例特定的检查清单项目,评估预定的参考因素是否被忠实地保留、正确地解离并绑定到其目标,以及根据指令被适当实现。我们进一步介绍了Omni-R2VDataset,为更广泛的研究社区带来工业级的多任务R2V训练资源。该数据集主要基于大规模专业视频素材语料库,包含340K个处理后的训练样本,覆盖多样化的参考类型和多参考组合。我们开发了用于参考-目标对构建的特定任务流水线,为全能R2V数据构建提供实用且可扩展的方案。对先进的开源和闭源R2V模型的广泛评估揭示了在OmniVBench上不同任务族和评估维度之间的明显性能差距,突出了当前R2V模型的局限性。
查看原文
查看缓存全文

缓存时间: 2026/09/21 03:20

论文页面 - OmniVBench:面向全模态参考到视频生成的基准测试与大规模数据集

来源:https://huggingface.co/papers/2609.22069 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

参考到视频(R2V)生成正朝着日益通用和多样的参考控制方向发展,催生了新兴的全模态R2V生成范式。然而,现有基准测试未能充分评估这些新兴能力:其测试用例涵盖的参考类型和组合有限,且评估协议主要评估整体参考一致性,忽略了参考因素是否被正确保留、解耦和分配。与此同时,构建全模态R2V训练数据的高成本导致合适的训练资源稀缺。为弥补这些不足,我们推出了OmniVBench和Omni-R2V数据集,用于评估和训练全模态R2V模型。OmniVBench将R2V评估扩展到更广泛的参考类型、细粒度控制任务和更丰富的参考组合中,涵盖7个任务族和18个细粒度任务,横跨内容、运动、风格、结构、叙事及多参考场景。我们引入基于因素的评估,包含12,172个案例特定的检查项,评估预期参考因素是否被忠实保留、正确解耦并绑定到其目标,以及是否根据指令被恰当实现。我们进一步推出Omni-R2V数据集,为广泛的R2V任务提供工业级训练资源。该数据集主要基于大规模专业视频素材构建,包含340,000个处理过的训练样本,涵盖多样参考类型和多参考组合。我们开发了针对参考-目标对构建的特定任务流程,为全模态R2V数据构建提供了实用且可扩展的方案。对先进的开源和闭源R2V模型进行的广泛评估显示,它们在OmniVBench上的任务族和评估维度上存在显著性能差距,凸显了当前R2V模型的现有局限性。

查看arXiv页面(https://arxiv.org/abs/2609.22069)查看PDF(https://arxiv.org/pdf/2609.22069)项目页面(https://wxliii.github.io/OmniVBench/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.22069)

在您的代理中获取此论文:

hf papers read 2609.22069

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.22069以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.22069以从本页面链接。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2609.22069以从本页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接。

相似文章

超大视频推理套件

Papers with Code Trending

本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。