LAION-BVD:用于多模态预训练的千万小时开放视频数据集

Hugging Face Daily Papers 论文

摘要

LAION-BVD是一个大规模开放视频数据集,包含1000万小时的视频数据,用于多模态预训练,具有合成字幕和竞争力的基准性能。

我们推出LAION-BVD,一个用于多模态学习的大规模开放视频数据集,包含从CommonCrawl收集的13亿个特定平台的视频URL。从中,我们下载了8000万个视频,总时长为1000万小时。该数据集旨在用于跨视频、音频和图像模态的多模态预训练。通过使用内容感知场景检测,我们提取片段并合成生成视频和音频字幕。在这些数据上训练的模型在标准视频-文本和音频-文本基准测试中取得了有竞争力的性能,并且随着训练或模型规模的增加而持续改进。此外,我们通过提取场景变化帧来探索视频帧作为图像-文本数据的替代来源。这些帧展现出与标准网络图像语料库不同的视觉分布,在该数据集上训练的模型在图像-文本检索性能上表现出色。我们将LAION-BVD发布给研究社区。它以前所未有的规模显著扩大了多模态视频的开放访问。
查看原文
查看缓存全文

缓存时间: 2026/08/26 07:14

论文页面 - LAION-BVD:用于多模态预训练的千万小时开放视频数据集

来源:https://huggingface.co/papers/2608.24845 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

LAION-BVD 是一个大规模开放视频数据集,支持跨视频、音频和图像模态的多模态预训练,提供合成字幕并在基准测试中表现优异。

我们推出 LAION-BVD (https://huggingface.co/papers?q=LAION-BVD),一个用于多模态学习 (https://huggingface.co/papers?q=multimodal%20learning) 的大规模开放视频数据集,包含从 CommonCrawl (https://huggingface.co/papers?q=CommonCrawl) 收集的 13 亿个平台特定的视频 URL。我们从中下载了 8000 万个视频,总时长达到 1000 万小时。该数据集专为跨视频、音频和图像模态的多模态预训练而设计。利用内容感知场景检测 (https://huggingface.co/papers?q=content-aware%20scene%20detection),我们提取片段并为其合成生成视频和音频字幕。在这些数据上训练的模型,在标准的视频-文本 (https://huggingface.co/papers?q=video-text) 和音频-文本 (https://huggingface.co/papers?q=audio-text) 基准测试中取得了有竞争力的表现,并且随着训练规模或模型规模的增加,性能持续提升。此外,我们通过提取场景变化帧,探索了将视频帧作为图像-文本数据的替代来源。这些帧展现出与标准网络图像语料库不同的视觉分布,在该数据集上训练的模型在图像-文本检索 (https://huggingface.co/papers?q=image-text%20retrieval) 任务上取得了强劲的性能。我们将 LAION-BVD (https://huggingface.co/papers?q=LAION-BVD) 发布给研究界。它以前所未有的规模,极大地扩展了对多模态视频的开放获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.24845)查看 PDF (https://arxiv.org/pdf/2608.24845)项目页面 (https://projects.laion.ai/bvd/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24845)

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.24845 以从此页面链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.24845 以从此页面链接它。

引用此论文的空间 0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2608.24845 以从此页面链接它。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

Laion 大型视频数据集

Hacker News Top

LAION-BVD 是一个面向多模态预训练的大规模开放视频数据集,包含8000万个视频,并在标准基准测试中表现优异,旨在支持人工智能领域的开放研究。

HumanNet:将以人为本的视频学习扩展至百万小时规模

Hugging Face Daily Papers

HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。

PHANTOM:面向视觉语言模型的大规模多模态对抗攻击数据集

arXiv cs.AI

介绍了PHANTOM,一个大规模的开源预生成对抗攻击数据集,用于视觉语言模型,涵盖1010个高级类别和55个有害意图子类别,共47,524个对抗样本。该数据集旨在降低对抗研究的门槛,并支持对VLM鲁棒性和安全性的系统评估。