ShotPlan:基于可学习规划标记的电影级视频生成

Hugging Face Daily Papers 论文

摘要

ShotPlan 引入了带有分数时间旋转位置嵌入的可学习规划标记,用于电影级多镜头视频生成,实现了显式的镜头级规划,并获得了卓越的镜头间一致性。

当前的视频生成模型在单镜头生成方面取得了令人印象深刻的结果,但在电影级视频生成方面仍存在局限性,因为连贯的叙事和有效的多镜头构图需要明确的镜头规划。为了解决这一挑战,我们提出了 ShotPlan,这是一个基于视频扩散基础模型构建的显式多镜头电影级视频生成框架。我们的方法引入了可学习的规划标记,这些标记能够捕捉镜头间的转场线索,并且可以与原始视频生成标记无缝集成,以控制转场时间戳。与标准的视频生成标记不同,所提出的规划标记配备了分数时间旋转位置嵌入(FRoPE),从而能够在帧级别对镜头转场进行建模。实验表明,ShotPlan 显著优于现有的电影级视频生成方法,提供了更灵活的镜头管理和更强的镜头间一致性。
查看原文
查看缓存全文

缓存时间: 2026/07/21 14:37

论文页面 - ShotPlan:基于可学习规划令牌的电影级视频生成

来源:https://huggingface.co/papers/2607.17675 发布于 7月20日

·

由 https://huggingface.co/Pensioner 提交

suguo (https://huggingface.co/Pensioner) 于 7月21日

摘要

当前视频生成模型在单镜头生成方面取得了令人瞩目的成果,但在电影级视频生成方面仍存在局限——连贯的叙事和高效的多镜头构图需要明确的镜头规划。为应对这一挑战,我们提出ShotPlan框架,该框架基于视频扩散基础模型构建,能够显式地进行多镜头电影级视频生成。该方法引入可学习的规划令牌(planning tokens),用于捕获镜头级别的过渡线索,并能与原始视频生成令牌无缝集成,从而控制过渡时间戳。与标准视频生成令牌不同,所提出的规划令牌配备了分数阶时间旋转位置编码(FRoPE),可在帧级别对镜头过渡进行建模。实验表明,ShotPlan在性能上显著优于现有电影级视频生成方法,提供更灵活的镜头管理和更强的镜头间一致性。

查看 arXiv 页面 (https://arxiv.org/abs/2607.17675)查看 PDF (https://arxiv.org/pdf/2607.17675)项目页面 (https://pensioner-11.github.io/ShotPlan/)GitHub5 (https://github.com/Pensioner-11/ShotPlan)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.17675)

在你的代理中获取本篇论文:

hf papers read 2607.17675

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

暂无模型关联本论文

请在模型 README.md 中引用 arxiv.org/abs/2607.17675 以从本页面链接。

引用本论文的数据集0

暂无数据集关联本论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.17675 以从本页面链接。

引用本论文的Space0

暂无Space关联本论文

请在Space README.md 中引用 arxiv.org/abs/2607.17675 以从本页面链接。

包含本论文的收藏集0

暂无收藏集包含本论文

请将本论文添加至一个收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

UnityShots:基于记忆的多镜头音视频生成与边界感知门控

Hugging Face Daily Papers

UnityShots 是一个基于记忆的多镜头音视频生成系统,通过固定大小的长期记忆槽和短期记忆槽,结合边界条件门控与离散切类型先验,在视频切换中保持主体外观和音频的一致性。该系统在跨镜头一致性指标上优于开源基线,并达到与闭源系统相当的水平。