Laion 大型视频数据集
摘要
LAION-BVD 是一个面向多模态预训练的大规模开放视频数据集,包含8000万个视频,并在标准基准测试中表现优异,旨在支持人工智能领域的开放研究。
暂无内容
查看缓存全文
缓存时间: 2026/08/27 03:19
# LAION 大型视频数据集
来源: https://projects.laion.ai/bvd/
开放研究数据集
·Marianna Nezhurina2,3,\*·Mehdi Cherti2,3·Andrej Radonjic4·Thaddäus Wiedemer5,1·Christoph Schuhmann2·Romain Beaumont2·Wieland Brendel5·Bernhard Schölkopf5·A\. Sophia Koepke1,6,◇·Jenia Jitsev2,3,◇·Matthias Bethge1,◇
阅读论文 (https://arxiv.org/abs/2608.24845)下载数据集 (https://projects.laion.ai/bvd/download.html)GitHub (https://github.com/LAION-AI/BVD)
https://projects.laion.ai/bvd/#scale
\*共同第一作者•◇共同通讯作者
1蒂宾根人工智能中心,蒂宾根大学2LAION3于利希研究中心(FZJ)亥姆霍兹信息学中心(JSC)4Wynd Labs5马克斯·普朗克智能系统研究所,蒂宾根ELLIS研究所6慕尼黑工业大学,慕尼黑机器学习中心(MCML)
附属机构
概述
## 摘要
我们推出**LAION\-BVD**(LAION — 大型视频数据集),一个用于多模态学习的大规模开放视频数据集,包含从CommonCrawl收集的*13亿个平台特定的视频URL*。我们从中下载了8000万个视频,总时长达到*1000万小时*。该数据集专为跨视频、音频和图像模态的多模态预训练而设计。利用内容感知的场景检测技术,我们提取片段,并为这些片段合成了视频和音频描述文本。在这些数据上训练的模型在标准的视频-文本和音频-文本基准测试中取得了有竞争力的表现,并且随着训练规模或模型规模的扩大,性能持续提升。此外,我们探索了将视频帧作为图像-文本数据替代来源的可能性,通过提取场景变化帧。这些帧展现出与标准网页图像语料库不同的视觉分布,在此数据集上训练的模型在图像-文本检索任务上表现优异。我们将LAION-BVD发布给研究社区。它以前所未有的规模,显著扩展了对多模态视频的开放访问。
关键数据
## 前所未有的规模
面向多模态学习研究的、最大的开放可访问视频语料库
🔗
0
视频URL
从Common Crawl收集的平台特定URL
🎬
0
已下载视频
成功下载并处理的视频
⏱️
0
总时长
所有下载内容合并的视频时长
✂️
0
已标注片段
带有合成视频描述文本的片段
🖼️
0
提取帧
用于图像-文本预训练的视频帧
基准测试
## 实验结果
在LAION\-BVD上训练的模型在视频、音频和图像-文本基准测试中均取得了有竞争力的表现
### 视频-语言基准测试
在LAION\-BVD上训练的ViCLIP模型在标准视频-文本基准测试中,达到甚至超越了InternVid训练的模型,最高提升达2\.1%,并且随着训练规模从1000万片段增长到5000万片段,性能持续提升。
- 相比InternVid (FLT)基线最高提升\+2\.1%
- 在1000万至5000万片段间持续获得增益
- 包含5500万个带有合成视频描述文本的片段
### 音频-语言基准测试
在LAION\-BVD上训练的CLAP模型,通过利用直接从视频中提取的丰富野外声景,在与其他大规模未经整理的音频数据集竞争中取得了有竞争力的表现。
- 与未经整理的音频数据集具有竞争力
- 音频-文本对源自多样化的视频内容
- 在增加模型和数据规模时表现出良好的扩展趋势
### 图像-文本基准测试
基于帧的CLIP模型在标准基准测试上取得了强大的图像-文本检索性能。视频帧展现出与典型网页语料库不同的视觉分布,补充了现有的图像预训练数据源。
- 在标准基准测试上具有强大的检索能力
- 3亿帧具有独特视觉分布的帧
- 补充了标准的网页图像数据集
负责任使用
## 伦理与发布声明
LAION\-BVD的发布旨在支持大规模、开放且可重现的多模态研究。大规模视频数据集以及在其上训练的模型日益集中在少数几家以专有技术为主的公司手中,这限制了独立的科学研究和可重现性。通过提供这一学术研究的开放资源,我们旨在拓宽对多模态训练数据的访问途径,并实现对大规模视频、音频和图像模型更透明的评估。
LAION\-BVD*仅限用于研究目的,不得用于商业用途*。该数据集旨在支持科学研究、可重现性、安全性分析,以及多模态基础模型及相关系统的研究。我们鼓励用户尊重内容创作者的权利和版权,并负责任地、根据适用法律和平台条款使用该数据集。
与其他大规模网络数据集一样,LAION\-BVD可能包含偏见、刻板印象,以及在语言、地区和主题上分布不均的内容。在此数据上训练的模型可能继承这些偏见。使用该数据集的研究人员应意识到这些局限性,并在相关情况下,在评估模型能力的同时评估并报告这些局限性。
引用
## 引用
``
@misc{laionbvd2026,
title={LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training},
author={Andreas Hochlehnert and Marianna Nezhurina and Mehdi Cherti and Andrej Radonjic and Thaddäus Wiedemer and Christoph Schuhmann and Romain Beaumont and Wieland Brendel and Bernhard Schölkopf and A. Sophia Koepke and Jenia Jitsev and Matthias Bethge},
year={2026},
eprint={2608.24845},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2608.24845},
}
``
相似文章
LAION-BVD:用于多模态预训练的千万小时开放视频数据集
LAION-BVD是一个大规模开放视频数据集,包含1000万小时的视频数据,用于多模态预训练,具有合成字幕和竞争力的基准性能。
HumanNet:将以人为本的视频学习扩展至百万小时规模
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。
PHANTOM:面向视觉语言模型的大规模多模态对抗攻击数据集
介绍了PHANTOM,一个大规模的开源预生成对抗攻击数据集,用于视觉语言模型,涵盖1010个高级类别和55个有害意图子类别,共47,524个对抗样本。该数据集旨在降低对抗研究的门槛,并支持对VLM鲁棒性和安全性的系统评估。