流式视频编辑与便捷适配

Hugging Face Daily Papers 论文

摘要

本文介绍了SVEET,一个用于高质量流式视频编辑的框架,它利用预训练的视频扩散模型,实现自动回归编辑,并在单个GPU上实现实时性能。

在本文中,我们提出了SVEET,一个仅需在预训练的双向视频扩散模型上进行训练,但支持以自动回归方式进行高质量流式视频编辑的框架。为了解决这个问题,我们首先系统地回顾了现有的视频到视频扩散方法,并确定了此类流式适配的两个关键原则:骨干特征解耦和条件帧独立性。基于这些见解,我们开发了一种用于可控视频生成的新范式。其核心是,一个辅助模型分支使用时间独立自注意力编码源视频输入,中间特征被注入到相应的骨干块中,以实现流式兼容控制。此外,为了弥合双向模型和流式模型特征空间之间的差异,我们提出了一种解耦训练方案,该方案显式地强制视频可控性和模型因果性优化方向之间的正交性。这种解耦确保了在推理时两个目标之间的兼容性,并促进了跨异构骨干架构的平滑零样本知识迁移。大量实验表明,SVEET在保持实时性能的同时,实现了卓越的编辑质量,在单个H100 GPU上达到了15 FPS,无需任何辅助加速技术。代码可在 https://github.com/YujiaHu1109/SVEET 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/22 11:26

论文页面 - 易于适配的流式视频编辑

来源: https://huggingface.co/papers/2609.24788

摘要

本文提出SVEET框架,该框架仅需在预训练的双向视频扩散模型上进行训练,即可支持高质量的流式视频自回归编辑。为解决此问题,我们首先系统性地回顾了现有的视频到视频扩散方法,并为这类流式适配识别出两个关键原则:骨干网络特征解耦与条件帧独立性。基于这些洞察,我们开发了一种用于可控视频生成的新范式。其核心在于,一个辅助模型分支通过时间独立的自注意力机制编码源视频输入,并将中间特征注入到对应的骨干网络块中,以实现兼容流式的控制。此外,为弥合双向模型与流式模型特征空间之间的差异,我们提出了一种解耦训练方案,该方案显式地强制视频可控性优化方向与模型因果性方向正交。这种解耦确保了推理时两个目标的兼容性,并促进了异构骨干网络架构之间平滑的零样本知识迁移。大量实验表明,SVEET在保持实时性能(在单张H100 GPU上实现15 FPS,无需任何辅助加速技术)的同时,达到了卓越的编辑质量。代码已发布于:https://github.com/YujiaHu1109/SVEET。

查看arXiv页面 (https://arxiv.org/abs/2609.24788) 查看PDF (https://arxiv.org/pdf/2609.24788) GitHub9 (https://github.com/YujiaHu1109/SVEET) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.24788)

通过您的代理获取本文:

hf papers read 2609.24788

尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

暂无模型链接本文

在模型README.md中引用 arxiv.org/abs/2609.24788 以将其链接到此页面。

引用本文的数据集 0

暂无数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2609.24788 以将其链接到此页面。

引用本文的Space 0

暂无Space链接本文

在Space README.md中引用 arxiv.org/abs/2609.24788 以将其链接到此页面。

包含本文的合集 0

暂无合集包含本文

将本文添加到合集 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章