长形式多镜头视频生成的多网格后训练
摘要
MovieGrid是一种多网格后训练范式,它将长视频分解为空间排列的块,以提高多镜头的连贯性和效率,在视频生成中实现了最先进的镜头内和镜头间一致性。
查看缓存全文
缓存时间: 2026/09/09 04:29
论文页面 - 长视频多镜头生成的多网格后训练方法
来源: https://huggingface.co/papers/2609.06373 作者:
,
,
,
,
,
,
,
,
,
摘要
MovieGrid将长视频分解为按空间排列的片段进行联合建模,提升了多镜头连贯性并高效扩展视频长度。
生成长视频多镜头内容需要镜头内的连贯运动以及镜头间视觉一致的叙事。现有视频生成器倾向于连续运动,难以在完整叙事沿单一时间轴排列时呈现完整的镜头序列。我们提出MovieGrid(https://huggingface.co/papers?q=MovieGrid),这是一种多网格后训练(https://huggingface.co/papers?q=Multi-Grid%20Post-Training)范式,将长视频分解为更短的时间有序片段,并将它们排列在空间网格上进行联合建模。该设计减少了每个时间轴处理的镜头数量,同时实现了跨片段的全局信息交换。我们通过源视频收集、层次分割、网格视频(https://huggingface.co/papers?q=grid%20video)构建和角色感知故事标注,从1000个长视频构建了多网格长视频(MGLV)数据集,生成了54K个配对故事提示的网格视频(https://huggingface.co/papers?q=grid%20video)。我们的无噪声随机网格训练(https://huggingface.co/papers?q=Noise-Free%20Random-Grid%20Training)保留随机子集片段作为干净视觉上下文,用于去噪其余片段。网格嵌入(https://huggingface.co/papers?q=Grid%20Embedding)编码网格结构,角色感知故事提示关联重复实体,网格边界损失(https://huggingface.co/papers?q=Grid%20Boundary%20Loss)稳定布局。在相同token预算下,MovieGrid(https://huggingface.co/papers?q=MovieGrid)在1616帧视频中生成的镜头数量是时间打包方法的6.05倍。在涵盖五个现实世界类别的基准测试中,它实现了最先进的镜头内一致性(https://huggingface.co/papers?q=intra-shot%20consistency)(0.9131 vs HoloCine的0.8086)和镜头间一致性(https://huggingface.co/papers?q=inter-shot%20consistency)(0.5914 vs StoryMem的0.5384)。MovieGrid(https://huggingface.co/papers?q=MovieGrid)可以通过单次或多次生成进一步扩展视频长度,且影响极小。
查看arXiv页面(https://arxiv.org/abs/2609.06373)查看PDF(https://arxiv.org/pdf/2609.06373)项目页面(https://jwmao1.github.io/moviegrid_web)GitHub0(https://github.com/jwmao1/moviegrid)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.06373)
通过代理获取本文:
hf papers read 2609\.06373
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型README.md中引用arxiv.org/abs/2609.06373以从本页面链接。
引用本文的数据集0
无数据集链接本文
在数据集README.md中引用arxiv.org/abs/2609.06373以从本页面链接。
引用本文的空间0
无空间链接本文
在空间README.md中引用arxiv.org/abs/2609.06373以从本页面链接。
包含本文的收藏集0
无收藏集包含本文
将本文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接。
相似文章
GridProbe:针对长视频 VLM 自适应推理时计算的后验探测方法
GridProbe 是一种无需训练的长视频 VLM 推理范式,它通过后验探测自适应地选择相关帧,在几乎不损失准确率的情况下实现了低于二次方的注意力计算成本。
MilliVid:用于视频生成中长程一致性的分层潜在变量
本文介绍了MilliVid,一种通过使用多尺度自编码器将帧压缩为分层标记,然后使用由粗到细的扩散模型生成它们,从而提升视频生成中长程一致性的方法,在Minecraft视频上超越了基线模型。
增强无需训练的无限帧生成以实现一致的长视频
MIGA是一种无需训练的方法,通过减少训练与推理之间的差距并利用双重一致性机制增强时间一致性来生成一致的长视频。
MVTrack4Gen:多视角点跟踪作为4D视频生成的几何监督
MVTrack4Gen提出了一种训练框架,利用多视角点跟踪作为几何监督来增强运动感知扩散模型,在从单目视频生成新视角视频中实现了最先进的几何一致性和运动保真度。
MV-Forcing:通过4D基底的时空自强迫实现长时间多视角视频生成
MV-Forcing 提出了一种扩散框架,结合时间自回归和视角自回归,生成动态场景的长时间多视角一致视频。通过使用4D几何桥梁和时空蒸馏,实现基于少步学生模型的任意长度视频生成。