CausalCine:用于多镜头视频叙事的实时自回归生成
摘要
CausalCine 是一个新的学术框架,用于实时交互式多镜头视频生成,它利用因果建模和动态内存路由技术,提高了自回归模型在镜头间的一致性。
查看缓存全文
缓存时间: 2026/05/13 04:12
论文页面 - CausalCine:用于多镜头视频叙事的实时自回归生成
来源:https://huggingface.co/papers/2605.12496 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
CausalCine 通过因果建模、动态记忆路由和实时蒸馏技术,解决了自回归模型的局限性,从而实现交互式、多镜头的视频生成。
自回归视频生成(https://huggingface.co/papers?q=Autoregressive%20video%20generation)旨在实现实时、开放式的合成。然而,电影叙事不仅仅是单一场景的无限延伸;它需要经历不断演变的事件、视角的转换以及离散的镜头边界。现有的自回归模型往往难以应对这种设置。由于主要训练用于短视野的延续,它们将长序列视为延长的单一镜头,在长时间 rollout(生成展开)过程中不可避免地出现运动停滞和语义漂移。为了弥补这一差距,我们引入了 CausalCine,这是一个交互式的自回归框架,它将多镜头视频生成(https://huggingface.co/papers?q=multi-shot%20video%20generation)转化为在线导演过程。CausalCine 在镜头切换处进行因果生成,接受动态提示,并复用上下文而无需重新生成之前的镜头。为实现这一目标,我们首先在原生多镜头序列上训练因果基座模型(causal base model)(https://huggingface.co/papers?q=causal%20base%20model),以学习加速前的复杂镜头转换。随后,我们提出了内容感知记忆路由(Content-Aware Memory Routing, CAMR)(https://huggingface.co/papers?q=Content-Aware%20Memory%20Routing),它根据基于注意力的相关性得分(attention-based relevance scores)(https://huggingface.co/papers?q=attention-based%20relevance%20scores)动态检索历史键值(KV)条目,而不是依据时间邻近性,从而在有限的活动内存下保持跨镜头一致性(cross-shot coherence)(https://huggingface.co/papers?q=cross-shot%20coherence)。最后,我们将因果基座模型(https://huggingface.co/papers?q=causal%20base%20model)蒸馏为少步生成器,以实现实时交互式生成(interactive generation)(https://huggingface.co/papers?q=interactive%20generation)。大量实验表明,CausalCine 显著优于自回归基线模型,并接近双向模型的能力,同时释放了因果生成的流式交互潜力。演示视频请访问:https://yihao-meng.github.io/CausalCine/
查看 arXiv 页面 (https://arxiv.org/abs/2605.12496) 查看 PDF (https://arxiv.org/pdf/2605.12496) 项目页面 (https://yihao-meng.github.io/CausalCine/) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.12496)
在你的 agent 中获取这篇论文:
hf papers read 2605.12496
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.12496 即可从本页链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.12496 即可从本页链接到该数据集。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.12496 即可从本页链接到该 Space。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到该收藏集。
相似文章
Causal Forcing++:可扩展的少步自回归扩散蒸馏,用于实时交互式视频生成
Causal Forcing++提出了一种新颖的因果一致性蒸馏方法,用于逐帧自回归视频生成,在降低延迟和训练成本的同时实现了最先进的质量。
YoCausal: 视频生成距离世界模型有多远?因果视角
本文介绍了YoCausal,一个基于认知科学中的违反预期(Violation of Expectation)范式的基准,用于评估视频扩散模型是否真正理解因果关系,还是仅仅过拟合于时间模式。对13个最先进模型的评估显示,与人类级别的因果认知相比,存在显著差距。
Next Forcing:基于多块预测的因果世界建模
Next Forcing 提出了一种用于因果世界建模的多块预测框架,可加速自回归视频生成的训练和推理,同时提高准确性和对物理规律的遵循程度。
Causal-rCM: 用于流式视频生成和交互世界模型的自回归扩散蒸馏的统一教师强制与自强制开放方案
本文介绍了Causal-rCM,这是一个统一的教师强制与自强制框架,用于流式视频生成和交互世界模型中的自回归扩散蒸馏,以快速收敛实现了最先进的性能。
SmartDirector: 关键帧条件化的电影视频生成与叙事节奏控制
SmartDirector是一个通过多关键帧增强视频生成的框架,旨在改善叙事结构和时间节奏,采用低分辨率生成和高分辨率优化的两阶段流程。