CausalCine:用于多镜头视频叙事的实时自回归生成

Hugging Face Daily Papers 论文

摘要

CausalCine 是一个新的学术框架,用于实时交互式多镜头视频生成,它利用因果建模和动态内存路由技术,提高了自回归模型在镜头间的一致性。

自回归视频生成旨在实现实时的、开放式的合成。然而,电影叙事不仅仅是单一场景的无限延伸;它需要随着事件的演变、视角的转换以及离散的镜头边界而推进。现有的自回归模型在此类设置中往往表现不佳。这些模型主要训练用于短期延续,将长序列视为延长的单镜头,在长序列生成过程中不可避免地会出现运动停滞和语义漂移的问题。为了弥合这一差距,我们提出了 CausalCine,这是一个交互式的自回归框架,将多镜头视频生成转化为一个在线导演过程。CausalCine 在镜头切换时进行因果生成,实时接受动态提示,并复用上下文而无需重新生成之前的镜头。为实现这一目标,我们首先在原生多镜头序列上训练一个因果基础模型,以在加速之前学习复杂的镜头过渡。随后,我们提出了内容感知内存路由(Content-Aware Memory Routing, CAMR),它根据基于注意力的相关性分数而非时间邻近度,动态检索历史键值(KV)条目,在有限的活动内存下保持镜头间的一致性。最后,我们将因果基础模型蒸馏为少步生成器,以实现实时交互生成。大量实验表明,CausalCine 显著优于自回归基线模型,并接近双向模型的能力,同时解锁了因果生成的流式交互性。演示视频请访问 https://yihao-meng.github.io/CausalCine/
查看原文
查看缓存全文

缓存时间: 2026/05/13 04:12

论文页面 - CausalCine:用于多镜头视频叙事的实时自回归生成

来源:https://huggingface.co/papers/2605.12496 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

CausalCine 通过因果建模、动态记忆路由和实时蒸馏技术,解决了自回归模型的局限性,从而实现交互式、多镜头的视频生成。

自回归视频生成(https://huggingface.co/papers?q=Autoregressive%20video%20generation)旨在实现实时、开放式的合成。然而,电影叙事不仅仅是单一场景的无限延伸;它需要经历不断演变的事件、视角的转换以及离散的镜头边界。现有的自回归模型往往难以应对这种设置。由于主要训练用于短视野的延续,它们将长序列视为延长的单一镜头,在长时间 rollout(生成展开)过程中不可避免地出现运动停滞和语义漂移。为了弥补这一差距,我们引入了 CausalCine,这是一个交互式的自回归框架,它将多镜头视频生成(https://huggingface.co/papers?q=multi-shot%20video%20generation)转化为在线导演过程。CausalCine 在镜头切换处进行因果生成,接受动态提示,并复用上下文而无需重新生成之前的镜头。为实现这一目标,我们首先在原生多镜头序列上训练因果基座模型(causal base model)(https://huggingface.co/papers?q=causal%20base%20model),以学习加速前的复杂镜头转换。随后,我们提出了内容感知记忆路由(Content-Aware Memory Routing, CAMR)(https://huggingface.co/papers?q=Content-Aware%20Memory%20Routing),它根据基于注意力的相关性得分(attention-based relevance scores)(https://huggingface.co/papers?q=attention-based%20relevance%20scores)动态检索历史键值(KV)条目,而不是依据时间邻近性,从而在有限的活动内存下保持跨镜头一致性(cross-shot coherence)(https://huggingface.co/papers?q=cross-shot%20coherence)。最后,我们将因果基座模型(https://huggingface.co/papers?q=causal%20base%20model)蒸馏为少步生成器,以实现实时交互式生成(interactive generation)(https://huggingface.co/papers?q=interactive%20generation)。大量实验表明,CausalCine 显著优于自回归基线模型,并接近双向模型的能力,同时释放了因果生成的流式交互潜力。演示视频请访问:https://yihao-meng.github.io/CausalCine/

查看 arXiv 页面 (https://arxiv.org/abs/2605.12496) 查看 PDF (https://arxiv.org/pdf/2605.12496) 项目页面 (https://yihao-meng.github.io/CausalCine/) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.12496)

在你的 agent 中获取这篇论文:

hf papers read 2605.12496

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.12496 即可从本页链接到该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.12496 即可从本页链接到该数据集。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.12496 即可从本页链接到该 Space。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到该收藏集。

相似文章

YoCausal: 视频生成距离世界模型有多远?因果视角

Hugging Face Daily Papers

本文介绍了YoCausal,一个基于认知科学中的违反预期(Violation of Expectation)范式的基准,用于评估视频扩散模型是否真正理解因果关系,还是仅仅过拟合于时间模式。对13个最先进模型的评估显示,与人类级别的因果认知相比,存在显著差距。