流式视频编辑与便捷适配
摘要
本文介绍了SVEET,一个用于高质量流式视频编辑的框架,它利用预训练的视频扩散模型,实现自动回归编辑,并在单个GPU上实现实时性能。
查看缓存全文
缓存时间: 2026/09/22 11:26
论文页面 - 易于适配的流式视频编辑
来源: https://huggingface.co/papers/2609.24788
摘要
本文提出SVEET框架,该框架仅需在预训练的双向视频扩散模型上进行训练,即可支持高质量的流式视频自回归编辑。为解决此问题,我们首先系统性地回顾了现有的视频到视频扩散方法,并为这类流式适配识别出两个关键原则:骨干网络特征解耦与条件帧独立性。基于这些洞察,我们开发了一种用于可控视频生成的新范式。其核心在于,一个辅助模型分支通过时间独立的自注意力机制编码源视频输入,并将中间特征注入到对应的骨干网络块中,以实现兼容流式的控制。此外,为弥合双向模型与流式模型特征空间之间的差异,我们提出了一种解耦训练方案,该方案显式地强制视频可控性优化方向与模型因果性方向正交。这种解耦确保了推理时两个目标的兼容性,并促进了异构骨干网络架构之间平滑的零样本知识迁移。大量实验表明,SVEET在保持实时性能(在单张H100 GPU上实现15 FPS,无需任何辅助加速技术)的同时,达到了卓越的编辑质量。代码已发布于:https://github.com/YujiaHu1109/SVEET。
查看arXiv页面 (https://arxiv.org/abs/2609.24788) 查看PDF (https://arxiv.org/pdf/2609.24788) GitHub9 (https://github.com/YujiaHu1109/SVEET) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.24788)
通过您的代理获取本文:
hf papers read 2609.24788
尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
暂无模型链接本文
在模型README.md中引用 arxiv.org/abs/2609.24788 以将其链接到此页面。
引用本文的数据集 0
暂无数据集链接本文
在数据集README.md中引用 arxiv.org/abs/2609.24788 以将其链接到此页面。
引用本文的Space 0
暂无Space链接本文
在Space README.md中引用 arxiv.org/abs/2609.24788 以将其链接到此页面。
包含本文的合集 0
暂无合集包含本文
将本文添加到合集 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
LiveEdit:迈向基于扩散模型的实时流式视频编辑
LiveEdit 提出了一种因果、逐帧的流式视频编辑框架,通过三阶段蒸馏流程和面向增强现实的掩码缓存实现了实时性能(12.66 FPS),从而能够进行稳定的长时编辑。
JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑
JoyAI-Video-Edit 是一个具有 160 亿参数的自回归扩散框架,用于实时、开放式视频编辑,可在单个 NVIDIA B200 GPU 上实现约 30 FPS 的 720p 编辑。
一个编辑器,多样编辑:面向多样视频编辑的统一无训练框架
EditVid是一个统一的无训练视频编辑框架,利用稀疏因果记忆、令牌注入和软潜在混合,支持指令引导和主题引导的编辑,实现高保真并在基准测试中优于基线方法。
LongE2V: 基于视频扩散模型的长时段事件视频重建、预测与帧插值
LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。
InfinityEdit:配备轻量级编辑启动适配器的无限视频编辑
InfinityEdit 提出了一种轻量级适配器,用于无限视频编辑,该适配器通过使用历史、时序和编辑注意力模块,实现对流视频帧的连续编辑,并在无界序列上保持稳定性。