ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频生成
摘要
ContextMaster是一个统一的交互式多镜头视频生成模型,在生成、参考条件控制和编辑中维护共享历史,同时采用固定预算稀疏上下文路由和两阶段特权上下文蒸馏以提高效率。
查看缓存全文
缓存时间: 2026/08/07 09:56
论文页面 - ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频创作
来源:https://huggingface.co/papers/2608.04956 发布于 8月5日
·
提交者 xuguo 于 8月7日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
近期视频模型日益支持在单一模型内进行生成、参考条件控制和编辑,但通常将它们作为针对固定输入的独立操作来呈现。实际创作往往跨越多个镜头展开,要求一个模型能够从文本生成、跟随参考或编辑源视频,同时保持共享的历史信息。我们将这一场景形式化为交互式多镜头视频创作(IMVC),并引入ContextMaster——一个为这些操作提供角色感知上下文表示的统一模型。交互式模型必须保留对不断扩展的历史记录的访问,同时不能让每个去噪步骤的上下文读取成本增长。ContextMaster结合可复用的干净上下文状态与固定预算的稀疏上下文路由,并使用Constraint Sink来保持任务约束可见。为了应对稀疏上下文访问和少步去噪推理的双重挑战,我们提出了一种两阶段特权上下文蒸馏框架,该框架通过一致性蒸馏将完整上下文行为从密集教师模型迁移出来,然后通过分布匹配来优化部署时的推演。在三个原始任务上的实验表明,相较于专门的基线,任务完成度和跨镜头一致性均有提升。用户研究进一步验证了灵活组合的工作流,同时该模型在单块GPU上达到16 FPS。
查看 arXiv 页面 (https://arxiv.org/abs/2608.04956)查看 PDF (https://arxiv.org/pdf/2608.04956)项目页面 (https://guoxu1233.github.io/ContextMaster/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04956)
在你的智能体中获取此论文:
hf papers read 2608\.04956
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.04956,即可从本页关联该模型。
引用此论文的数据集0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.04956,即可从本页关联该数据集。
引用此论文的 Space0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.04956,即可从本页关联该 Space。
包含此论文的收藏集0
暂无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。
相似文章
PermaVid: 通过解耦上下文记忆实现编辑间一致的视频生成
PermaVid 引入了一种多模态上下文记忆,将外观和几何结构解耦,从而在编辑操作后保持长期视频一致性,超越了此前的方法。
CausalCine:用于多镜头视频叙事的实时自回归生成
CausalCine 是一个新的学术框架,用于实时交互式多镜头视频生成,它利用因果建模和动态内存路由技术,提高了自回归模型在镜头间的一致性。
Echo-Forcing: 一种用于交互式长视频生成的场景记忆框架
Echo-Forcing 提出了一种用于交互式长视频生成的场景记忆框架,利用分层时间记忆、场景召回帧和差异感知记忆衰减来处理提示切换和长期回忆。该方法无需训练,在 VBench-Long 上取得了强劲的性能。
通过上下文稀疏注意力实现闪电般的统一视频编辑
本文介绍了上下文稀疏注意力(ISA),这是一种通过裁剪冗余上下文和使用动态查询分组来显著降低视频编辑计算成本的框架。作者通过 LIVEditor 证明了该方法的有效性,在多个视频编辑基准测试中实现了近乎无损的加速和最新的技术结果。
UnityShots:基于记忆的多镜头音视频生成与边界感知门控
UnityShots 是一个基于记忆的多镜头音视频生成系统,通过固定大小的长期记忆槽和短期记忆槽,结合边界条件门控与离散切类型先验,在视频切换中保持主体外观和音频的一致性。该系统在跨镜头一致性指标上优于开源基线,并达到与闭源系统相当的水平。