ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频生成
摘要
ContextMaster是一个统一的交互式多镜头视频生成模型,在生成、参考条件控制和编辑中维护共享历史,同时采用固定预算稀疏上下文路由和两阶段特权上下文蒸馏以提高效率。
查看缓存全文
缓存时间: 2026/08/07 09:56
论文页面 - ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频创作
来源:https://huggingface.co/papers/2608.04956 发布于 8月5日
·
提交者 xuguo 于 8月7日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
近期视频模型日益支持在单一模型内进行生成、参考条件控制和编辑,但通常将它们作为针对固定输入的独立操作来呈现。实际创作往往跨越多个镜头展开,要求一个模型能够从文本生成、跟随参考或编辑源视频,同时保持共享的历史信息。我们将这一场景形式化为交互式多镜头视频创作(IMVC),并引入ContextMaster——一个为这些操作提供角色感知上下文表示的统一模型。交互式模型必须保留对不断扩展的历史记录的访问,同时不能让每个去噪步骤的上下文读取成本增长。ContextMaster结合可复用的干净上下文状态与固定预算的稀疏上下文路由,并使用Constraint Sink来保持任务约束可见。为了应对稀疏上下文访问和少步去噪推理的双重挑战,我们提出了一种两阶段特权上下文蒸馏框架,该框架通过一致性蒸馏将完整上下文行为从密集教师模型迁移出来,然后通过分布匹配来优化部署时的推演。在三个原始任务上的实验表明,相较于专门的基线,任务完成度和跨镜头一致性均有提升。用户研究进一步验证了灵活组合的工作流,同时该模型在单块GPU上达到16 FPS。
查看 arXiv 页面 (https://arxiv.org/abs/2608.04956)查看 PDF (https://arxiv.org/pdf/2608.04956)项目页面 (https://guoxu1233.github.io/ContextMaster/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04956)
在你的智能体中获取此论文:
hf papers read 2608\.04956
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.04956,即可从本页关联该模型。
引用此论文的数据集0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.04956,即可从本页关联该数据集。
引用此论文的 Space0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.04956,即可从本页关联该 Space。
包含此论文的收藏集0
暂无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。
相似文章
上下文匹配蒸馏:用于自回归视频蒸馏的教师因果性
上下文匹配蒸馏引入了一个因果框架,用于蒸馏自回归视频模型,通过将教师监督与学生的因果信息上下文对齐,提高了控制遵循性和长视频质量。
PermaVid: 通过解耦上下文记忆实现编辑间一致的视频生成
PermaVid 引入了一种多模态上下文记忆,将外观和几何结构解耦,从而在编辑操作后保持长期视频一致性,超越了此前的方法。
镜头思考:基于智能推理的一致性多镜头视频编辑
本文介绍了一种结合LLMs和VLMs的智能框架,用于跨多个镜头的一致性多指令视频编辑,并提出了MMLVE任务和基准来评估性能。
CausalCine:用于多镜头视频叙事的实时自回归生成
CausalCine 是一个新的学术框架,用于实时交互式多镜头视频生成,它利用因果建模和动态内存路由技术,提高了自回归模型在镜头间的一致性。
一个编辑器,多样编辑:面向多样视频编辑的统一无训练框架
EditVid是一个统一的无训练视频编辑框架,利用稀疏因果记忆、令牌注入和软潜在混合,支持指令引导和主题引导的编辑,实现高保真并在基准测试中优于基线方法。