ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频生成

Hugging Face Daily Papers 论文

摘要

ContextMaster是一个统一的交互式多镜头视频生成模型,在生成、参考条件控制和编辑中维护共享历史,同时采用固定预算稀疏上下文路由和两阶段特权上下文蒸馏以提高效率。

近期视频模型越来越支持在单一模型中实现生成、参考条件控制和编辑,但通常将它们作为固定输入上的独立操作。实际创作跨多个镜头展开,要求一个模型能够根据文本生成、遵循参考或编辑源素材,同时维护共享历史。我们将这一设置形式化为交互式多镜头视频生成(IMVC),并引入ContextMaster,这是一个统一模型,具有用于这些操作的角色感知上下文表示。交互式模型必须保留对不断扩展历史的访问,同时不允许每个去噪步骤的上下文读取成本增长。ContextMaster将可重用的干净上下文状态与固定预算稀疏上下文路由相结合,并使用ConstraintSink保持任务约束可见。为了解决稀疏上下文访问和少步去噪推理的双重挑战,我们提出了一种两阶段特权上下文蒸馏框架,该框架通过一致性蒸馏从密集教师模型转移完整上下文行为,然后通过分布匹配优化部署 rollout。在三个基本任务上的实验表明,与专门基线相比,任务完成度和跨镜头一致性有所提高。用户研究进一步验证了灵活组合的工作流程,而该模型在单个GPU上达到16 FPS。
查看原文
查看缓存全文

缓存时间: 2026/08/07 09:56

论文页面 - ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频创作

来源:https://huggingface.co/papers/2608.04956 发布于 8月5日

·

提交者 xuguo 于 8月7日

作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

近期视频模型日益支持在单一模型内进行生成、参考条件控制和编辑,但通常将它们作为针对固定输入的独立操作来呈现。实际创作往往跨越多个镜头展开,要求一个模型能够从文本生成、跟随参考或编辑源视频,同时保持共享的历史信息。我们将这一场景形式化为交互式多镜头视频创作(IMVC),并引入ContextMaster——一个为这些操作提供角色感知上下文表示的统一模型。交互式模型必须保留对不断扩展的历史记录的访问,同时不能让每个去噪步骤的上下文读取成本增长。ContextMaster结合可复用的干净上下文状态与固定预算的稀疏上下文路由,并使用Constraint Sink来保持任务约束可见。为了应对稀疏上下文访问和少步去噪推理的双重挑战,我们提出了一种两阶段特权上下文蒸馏框架,该框架通过一致性蒸馏将完整上下文行为从密集教师模型迁移出来,然后通过分布匹配来优化部署时的推演。在三个原始任务上的实验表明,相较于专门的基线,任务完成度和跨镜头一致性均有提升。用户研究进一步验证了灵活组合的工作流,同时该模型在单块GPU上达到16 FPS。

查看 arXiv 页面 (https://arxiv.org/abs/2608.04956)查看 PDF (https://arxiv.org/pdf/2608.04956)项目页面 (https://guoxu1233.github.io/ContextMaster/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04956)

在你的智能体中获取此论文:

hf papers read 2608\.04956

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.04956,即可从本页关联该模型。

引用此论文的数据集0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.04956,即可从本页关联该数据集。

引用此论文的 Space0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.04956,即可从本页关联该 Space。

包含此论文的收藏集0

暂无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。

相似文章

Echo-Forcing: 一种用于交互式长视频生成的场景记忆框架

Hugging Face Daily Papers

Echo-Forcing 提出了一种用于交互式长视频生成的场景记忆框架,利用分层时间记忆、场景召回帧和差异感知记忆衰减来处理提示切换和长期回忆。该方法无需训练,在 VBench-Long 上取得了强劲的性能。

通过上下文稀疏注意力实现闪电般的统一视频编辑

Hugging Face Daily Papers

本文介绍了上下文稀疏注意力(ISA),这是一种通过裁剪冗余上下文和使用动态查询分组来显著降低视频编辑计算成本的框架。作者通过 LIVEditor 证明了该方法的有效性,在多个视频编辑基准测试中实现了近乎无损的加速和最新的技术结果。

UnityShots:基于记忆的多镜头音视频生成与边界感知门控

Hugging Face Daily Papers

UnityShots 是一个基于记忆的多镜头音视频生成系统,通过固定大小的长期记忆槽和短期记忆槽,结合边界条件门控与离散切类型先验,在视频切换中保持主体外观和音频的一致性。该系统在跨镜头一致性指标上优于开源基线,并达到与闭源系统相当的水平。