移动字母:文本到视频生成训练数据的受控研究

Hugging Face Daily Papers 论文

摘要

本文介绍了移动字母(Moving Alphabet),一个用于受控实验的程序化测试平台,研究数据分布和字幕质量如何影响文本到视频模型,揭示了数据整理的关键见解。

文本到视频生成在过去五年中通过扩展模型规模、数据和计算取得了显著进展。与模型架构不同,训练数据往往未被充分探索。现实世界的数据整理复杂且非平凡,涉及从原始视频中剪辑片段,并通过字幕生成创建视频-文本对,以学习文本到视频的映射。我们研究了数据分布和字幕质量如何影响文本到视频模型。为了实现受控实验,我们引入了移动字母(Moving Alphabet),这是一个程序化测试平台,以黑色背景渲染具有不同字体、颜色、大小和位置的字母,并以不同方向和速度移动。该设计通过破坏真实元数据来精确控制数据分布和字幕质量。我们的实验得出三个发现:a) 视频内容和时长的多样且均衡分布对于泛化至关重要;b) 字幕质量显著影响模型性能和训练效率,表明文本到视频模型受限于视频理解能力;c) 无分类器引导和在高质量数据上的微调可以部分恢复因损坏字幕训练的模型,但无法完全弥补糟糕的预训练数据。我们相信这些见解可以为大规模文本到视频模型的开发提供参考,并呼吁更加关注预训练数据的科学。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

来源:https://huggingface.co/papers/2607.18789

摘要

过去五年间,文本到视频生成技术通过扩展模型规模、训练数据和计算量取得了显著进步。与模型架构不同,训练数据往往探索不足。真实世界的数据整理复杂且非平凡,涉及从原始视频中裁剪片段和生成字幕,以创建用于学习文本到视频映射的视频-文本对。我们研究了数据分布和字幕质量对文本到视频模型的影响。为了进行可控实验,我们引入了Moving Alphabet,一个程序化测试平台,在黑色背景上渲染不同字体、颜色、大小和位置的字母,并以不同方向和速度移动。这种设计允许通过破坏真实元数据来精确控制数据分布和字幕质量。我们的实验得出三个发现:a) 视频内容和时长的多样性与平衡分布对泛化能力至关重要;b) 字幕质量显著影响模型性能和训练效率,表明文本到视频模型受限于视频理解能力;c) 无分类器引导和在高质量数据上微调可以部分恢复因字幕受损而训练的模型,但无法完全弥补预训练数据的不足。我们相信这些见解可以为大规模文本到视频模型的开发提供参考,并呼吁对预训练数据的科学性给予更多关注。

查看 arXiv 页面 (https://arxiv.org/abs/2607.18789) 查看 PDF (https://arxiv.org/pdf/2607.18789) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18789)

在你的代理中获取本篇论文:

hf papers read 2607.18789

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本篇论文的模型0

没有模型链接到本篇论文

请在模型 README.md 中引用 arxiv.org/abs/2607.18789 以从此页面链接。

引用本篇论文的数据集0

没有数据集链接到本篇论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.18789 以从此页面链接。

引用本篇论文的空间0

没有空间链接到本篇论文

请在空间 README.md 中引用 arxiv.org/abs/2607.18789 以从此页面链接。

包含本篇论文的收藏0

没有收藏包含本篇论文

请添加本篇论文到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

视频生成模型是通用视觉学习者

Hugging Face Daily Papers

本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。

OSCBench: 文本到视频生成中的对象状态变化基准测试

arXiv cs.CL

OSCBench是一个新的基准测试,用于评估文本到视频生成模型准确表示对象状态变化(由剥皮或切片等动作引起的转变)的能力。该论文表明,当前的T2V模型在处理时间上一致的状态变化方面存在困难,特别是在新颖和组合场景中,这被认定为视频生成的一个关键瓶颈。

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。

全模态密集视频字幕生成的并行自回归解码

Hugging Face Daily Papers

本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。