LAION-BVD:用于多模态预训练的千万小时开放视频数据集
摘要
LAION-BVD是一个大规模开放视频数据集,包含1000万小时的视频数据,用于多模态预训练,具有合成字幕和竞争力的基准性能。
查看缓存全文
缓存时间: 2026/08/26 07:14
论文页面 - LAION-BVD:用于多模态预训练的千万小时开放视频数据集
来源:https://huggingface.co/papers/2608.24845 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
LAION-BVD 是一个大规模开放视频数据集,支持跨视频、音频和图像模态的多模态预训练,提供合成字幕并在基准测试中表现优异。
我们推出 LAION-BVD (https://huggingface.co/papers?q=LAION-BVD),一个用于多模态学习 (https://huggingface.co/papers?q=multimodal%20learning) 的大规模开放视频数据集,包含从 CommonCrawl (https://huggingface.co/papers?q=CommonCrawl) 收集的 13 亿个平台特定的视频 URL。我们从中下载了 8000 万个视频,总时长达到 1000 万小时。该数据集专为跨视频、音频和图像模态的多模态预训练而设计。利用内容感知场景检测 (https://huggingface.co/papers?q=content-aware%20scene%20detection),我们提取片段并为其合成生成视频和音频字幕。在这些数据上训练的模型,在标准的视频-文本 (https://huggingface.co/papers?q=video-text) 和音频-文本 (https://huggingface.co/papers?q=audio-text) 基准测试中取得了有竞争力的表现,并且随着训练规模或模型规模的增加,性能持续提升。此外,我们通过提取场景变化帧,探索了将视频帧作为图像-文本数据的替代来源。这些帧展现出与标准网络图像语料库不同的视觉分布,在该数据集上训练的模型在图像-文本检索 (https://huggingface.co/papers?q=image-text%20retrieval) 任务上取得了强劲的性能。我们将 LAION-BVD (https://huggingface.co/papers?q=LAION-BVD) 发布给研究界。它以前所未有的规模,极大地扩展了对多模态视频的开放获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.24845)查看 PDF (https://arxiv.org/pdf/2608.24845)项目页面 (https://projects.laion.ai/bvd/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24845)
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.24845 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.24845 以从此页面链接它。
引用此论文的空间 0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.24845 以从此页面链接它。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
Laion 大型视频数据集
LAION-BVD 是一个面向多模态预训练的大规模开放视频数据集,包含8000万个视频,并在标准基准测试中表现优异,旨在支持人工智能领域的开放研究。
HumanNet:将以人为本的视频学习扩展至百万小时规模
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。
PHANTOM:面向视觉语言模型的大规模多模态对抗攻击数据集
介绍了PHANTOM,一个大规模的开源预生成对抗攻击数据集,用于视觉语言模型,涵盖1010个高级类别和55个有害意图子类别,共47,524个对抗样本。该数据集旨在降低对抗研究的门槛,并支持对VLM鲁棒性和安全性的系统评估。
跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准综述
对跨视觉、语言、视频和音频的多模态遗忘方法、数据集和基准的综合综述,提供了分类法并强调了未解决问题。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。