VidaForge:开放研究基础设施的视频预训练数据配方
摘要
VidaForge 是一个开放研究基础设施,它将视频数据配方建模为可执行工作流,以研究其对视频基础模型预训练的影响,并发布了包含314万场景级剪辑的数据集供研究使用。
查看缓存全文
缓存时间: 2026/09/09 04:30
论文页面 - VidaForge:面向视频预训练数据配方的开放研究基础设施
来源:https://huggingface.co/papers/2609.06652
发布于 9 月 6 日
·
由 https://huggingface.co/ManTle 提交
Yan Ma (https://huggingface.co/ManTle) 于 9 月 9 日
摘要
VIDAFORGE 是一个开放基础设施,它将视频数据配方建模为可执行工作流,用以研究数据选择如何影响视频基础模型的预训练。
视频基础模型 (https://huggingface.co/papers?q=Video%20foundation%20models) 越来越依赖大规模预训练 (https://huggingface.co/papers?q=pretraining) 数据,然而其背后的端到端数据管道在很大程度上仍是封闭且难以检视或复用的。研究人员若想理解视频数据配方 (https://huggingface.co/papers?q=data%20recipes) 如何影响模型预训练 (https://huggingface.co/papers?q=pretraining),往往需要在测试哪怕一个聚焦的假设之前就构建大量基础设施。我们推出了 VIDAFORGE (https://huggingface.co/papers?q=VIDAFORGE),一个开放的研究基础设施,它将视频数据配方表示为一个从原始视频到训练数据集的五阶段可执行工作流。该工作流中的决策点可被调整以构建不同的数据集,同时保留每个样本的生成过程。为演示这一研究工作流,我们比较了具有不同覆盖范围和质量的配方在从头开始预训练 (https://huggingface.co/papers?q=pretraining) Wan 2.1 (https://huggingface.co/papers?q=Wan%202.1) 和 V-JEPA 2.1 (https://huggingface.co/papers?q=V-JEPA%202.1) 早期阶段的效果。在两种学习目标下,覆盖范围更广的配方在下游基准分数 (https://huggingface.co/papers?q=downstream%20benchmark%20scores) 上表现最佳,而基于损失的评估 (https://huggingface.co/papers?q=loss-based%20evaluation) 则倾向于不同的配方。本研究展示了 VidaForge (https://huggingface.co/papers?q=VidaForge) 如何将数据配方选择与下游模型性能联系起来。我们进一步发布了 VIDAFORGE-3M (https://huggingface.co/papers?q=VIDAFORGE-3M),其中包含 314 万个场景级片段,总计 6,475 小时,并附带用于视频数据配方研究的细粒度标注和筛选信号。
查看 arXiv 页面 (https://arxiv.org/abs/2609.06652)
查看 PDF (https://arxiv.org/pdf/2609.06652)
项目页面 (https://github.com/GAIR-NLP/VidaForge)
GitHub 88 (https://github.com/GAIR-NLP/VidaForge)
添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.06652)
在您的智能体中获取此论文:
hf papers read 2609.06652
没有最新 CLI?请运行:curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
无模型关联此论文。
在模型的 README.md 中引用 arxiv.org/abs/2609.06652 以从本页面关联它。
引用此论文的数据集 0
无数据集关联此论文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.06652 以从本页面关联它。
引用此论文的 Space 0
无 Space 关联此论文。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.06652 以从本页面关联它。
包含此论文的收藏集 0
无收藏集包含此论文。
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面关联它。
相似文章
Laion 大型视频数据集
LAION-BVD 是一个面向多模态预训练的大规模开放视频数据集,包含8000万个视频,并在标准基准测试中表现优异,旨在支持人工智能领域的开放研究。
OpenVisTool:合成指导性视觉工具使用轨迹的开放方法
本文介绍了 OpenVisTool,一个用于合成指导性视觉工具使用轨迹的开放框架,以及相应的数据集(OpenVisTool-42K)和基准。研究表明,在基于因果关系的监督下进行微调,能在多种模型骨干上提升视觉工具使用性能。
ID-V2V:身份保留的视频重风格化
ID-V2V 是一个用于身份保留视频重风格化的视频到视频生成框架。它将身份保留视为视频重光照问题,并使用编辑后的关键帧进行风格传播,无需配对训练数据即可实现高质量结果。
LAION-BVD:用于多模态预训练的千万小时开放视频数据集
LAION-BVD是一个大规模开放视频数据集,包含1000万小时的视频数据,用于多模态预训练,具有合成字幕和竞争力的基准性能。
VEFX-Bench:通用视频编辑与视觉特效的全方位基准
VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。