ShotPlan:基于可学习规划标记的电影级视频生成
摘要
ShotPlan 引入了带有分数时间旋转位置嵌入的可学习规划标记,用于电影级多镜头视频生成,实现了显式的镜头级规划,并获得了卓越的镜头间一致性。
查看缓存全文
缓存时间: 2026/07/21 14:37
论文页面 - ShotPlan:基于可学习规划令牌的电影级视频生成
来源:https://huggingface.co/papers/2607.17675 发布于 7月20日
·
由 https://huggingface.co/Pensioner 提交
suguo (https://huggingface.co/Pensioner) 于 7月21日
摘要
当前视频生成模型在单镜头生成方面取得了令人瞩目的成果,但在电影级视频生成方面仍存在局限——连贯的叙事和高效的多镜头构图需要明确的镜头规划。为应对这一挑战,我们提出ShotPlan框架,该框架基于视频扩散基础模型构建,能够显式地进行多镜头电影级视频生成。该方法引入可学习的规划令牌(planning tokens),用于捕获镜头级别的过渡线索,并能与原始视频生成令牌无缝集成,从而控制过渡时间戳。与标准视频生成令牌不同,所提出的规划令牌配备了分数阶时间旋转位置编码(FRoPE),可在帧级别对镜头过渡进行建模。实验表明,ShotPlan在性能上显著优于现有电影级视频生成方法,提供更灵活的镜头管理和更强的镜头间一致性。
查看 arXiv 页面 (https://arxiv.org/abs/2607.17675)查看 PDF (https://arxiv.org/pdf/2607.17675)项目页面 (https://pensioner-11.github.io/ShotPlan/)GitHub5 (https://github.com/Pensioner-11/ShotPlan)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.17675)
在你的代理中获取本篇论文:
hf papers read 2607.17675
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
暂无模型关联本论文
请在模型 README.md 中引用 arxiv.org/abs/2607.17675 以从本页面链接。
引用本论文的数据集0
暂无数据集关联本论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.17675 以从本页面链接。
引用本论文的Space0
暂无Space关联本论文
请在Space README.md 中引用 arxiv.org/abs/2607.17675 以从本页面链接。
包含本论文的收藏集0
暂无收藏集包含本论文
请将本论文添加至一个收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
实验用故事板规划的AI电影化场景,而非单提示生成
探讨了一种故事板规划的AI电影化场景方法,先构建序列结构再逐镜头生成,相比于单提示生成,能产生更连贯的视频,同时指出了当前弱点如身份漂移和交互物理。
SmartDirector: 关键帧条件化的电影视频生成与叙事节奏控制
SmartDirector是一个通过多关键帧增强视频生成的框架,旨在改善叙事结构和时间节奏,采用低分辨率生成和高分辨率优化的两阶段流程。
CausalCine:用于多镜头视频叙事的实时自回归生成
CausalCine 是一个新的学术框架,用于实时交互式多镜头视频生成,它利用因果建模和动态内存路由技术,提高了自回归模型在镜头间的一致性。
UnityShots:基于记忆的多镜头音视频生成与边界感知门控
UnityShots 是一个基于记忆的多镜头音视频生成系统,通过固定大小的长期记忆槽和短期记忆槽,结合边界条件门控与离散切类型先验,在视频切换中保持主体外观和音频的一致性。该系统在跨镜头一致性指标上优于开源基线,并达到与闭源系统相当的水平。
从计划到像素:学习规划和编排实现开放式图像编辑
一个针对长序列图像编辑的体验式框架,将规划与奖励驱动的执行相结合,以提高复杂多步编辑的连贯性和可靠性。