长形式多镜头视频生成的多网格后训练

Hugging Face Daily Papers 论文

摘要

MovieGrid是一种多网格后训练范式,它将长视频分解为空间排列的块,以提高多镜头的连贯性和效率,在视频生成中实现了最先进的镜头内和镜头间一致性。

生成长形式多镜头视频需要镜头内运动连贯且跨镜头的叙事视觉一致。现有视频生成器倾向于连续运动,当整个叙事沿单一时间轴打包时,难以呈现完整的镜头集。我们提出MovieGrid,一种多网格后训练范式,它将长视频分解为较短的、时间有序的块,并在空间网格上排列以进行联合建模。这种设计减少了每个时间轴处理的镜头数量,同时实现了跨块的全局信息交换。我们从1000个长视频中构建了多网格长视频(MGLV)数据集,使用源视频收集、层次分割、网格视频构建和角色感知故事标注,生成了54K个与故事提示配对的网格视频。我们的无噪声随机网格训练保留了块的随机子集作为干净视觉上下文,用于去噪剩余块。网格嵌入编码网格结构,角色感知故事提示链接重复实体,网格边界损失稳定布局。在相同的令牌预算下,MovieGrid在1616帧视频中生成的镜头比时间打包多6.05倍。在涵盖五个真实世界类别的基准测试中,它实现了最先进的镜头内一致性(0.9131 对比 HoloCine 的 0.8086)和镜头间一致性(0.5914 对比 StoryMem 的 0.5384)。MovieGrid可以通过单次或多次生成进一步扩展视频长度,且妥协最小。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:29

论文页面 - 长视频多镜头生成的多网格后训练方法

来源: https://huggingface.co/papers/2609.06373 作者:

,

,

,

,

,

,

,

,

,

摘要

MovieGrid将长视频分解为按空间排列的片段进行联合建模,提升了多镜头连贯性并高效扩展视频长度。

生成长视频多镜头内容需要镜头内的连贯运动以及镜头间视觉一致的叙事。现有视频生成器倾向于连续运动,难以在完整叙事沿单一时间轴排列时呈现完整的镜头序列。我们提出MovieGrid(https://huggingface.co/papers?q=MovieGrid),这是一种多网格后训练(https://huggingface.co/papers?q=Multi-Grid%20Post-Training)范式,将长视频分解为更短的时间有序片段,并将它们排列在空间网格上进行联合建模。该设计减少了每个时间轴处理的镜头数量,同时实现了跨片段的全局信息交换。我们通过源视频收集、层次分割、网格视频(https://huggingface.co/papers?q=grid%20video)构建和角色感知故事标注,从1000个长视频构建了多网格长视频(MGLV)数据集,生成了54K个配对故事提示的网格视频(https://huggingface.co/papers?q=grid%20video)。我们的无噪声随机网格训练(https://huggingface.co/papers?q=Noise-Free%20Random-Grid%20Training)保留随机子集片段作为干净视觉上下文,用于去噪其余片段。网格嵌入(https://huggingface.co/papers?q=Grid%20Embedding)编码网格结构,角色感知故事提示关联重复实体,网格边界损失(https://huggingface.co/papers?q=Grid%20Boundary%20Loss)稳定布局。在相同token预算下,MovieGrid(https://huggingface.co/papers?q=MovieGrid)在1616帧视频中生成的镜头数量是时间打包方法的6.05倍。在涵盖五个现实世界类别的基准测试中,它实现了最先进的镜头内一致性(https://huggingface.co/papers?q=intra-shot%20consistency)(0.9131 vs HoloCine的0.8086)和镜头间一致性(https://huggingface.co/papers?q=inter-shot%20consistency)(0.5914 vs StoryMem的0.5384)。MovieGrid(https://huggingface.co/papers?q=MovieGrid)可以通过单次或多次生成进一步扩展视频长度,且影响极小。

查看arXiv页面(https://arxiv.org/abs/2609.06373)查看PDF(https://arxiv.org/pdf/2609.06373)项目页面(https://jwmao1.github.io/moviegrid_web)GitHub0(https://github.com/jwmao1/moviegrid)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.06373)

通过代理获取本文:

hf papers read 2609\.06373

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型README.md中引用arxiv.org/abs/2609.06373以从本页面链接。

引用本文的数据集0

无数据集链接本文

在数据集README.md中引用arxiv.org/abs/2609.06373以从本页面链接。

引用本文的空间0

无空间链接本文

在空间README.md中引用arxiv.org/abs/2609.06373以从本页面链接。

包含本文的收藏集0

无收藏集包含本文

将本文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接。

相似文章

MilliVid:用于视频生成中长程一致性的分层潜在变量

Hugging Face Daily Papers

本文介绍了MilliVid,一种通过使用多尺度自编码器将帧压缩为分层标记,然后使用由粗到细的扩散模型生成它们,从而提升视频生成中长程一致性的方法,在Minecraft视频上超越了基线模型。