InfinityEdit:配备轻量级编辑启动适配器的无限视频编辑

Hugging Face Daily Papers 论文

摘要

InfinityEdit 提出了一种轻量级适配器,用于无限视频编辑,该适配器通过使用历史、时序和编辑注意力模块,实现对流视频帧的连续编辑,并在无界序列上保持稳定性。

借助大型预训练模型,现有方法已有效改进了基于指令的视频编辑。然而,大多数方法依赖于原地编辑假设。它们在固定时间跨度内逐帧将编辑后的视频与给定源片段对齐。这种模式在开放式流中失败,例如重新设计直播游戏或对持续镜头应用摄像机移动。在这种情况下,编辑必须扩展到未来帧到达时,而不是应用于静态输入片段。在本文中,我们研究这种设置并将其命名为无限视频编辑:给定前一个片段和编辑请求,模型必须生成下一个片段,在继续流的同时应用请求的编辑。这个过程随着无界编辑指令序列的到来而重复。此任务带来两个挑战:编辑必须是忠实的延续而不是逐帧重写,并且随着编辑积累,生成质量必须保持稳定。为了解决这些问题,我们首先为无限视频编辑设计了一个数据收集管道。基于收集的数据,我们提出了InfinityEdit,一个轻量级编辑适配器,为流视频生成器配备无界编辑能力。该适配器包含三个注意力模块。历史交叉注意力使用输入帧引导去噪帧。时序因果自注意力保持时序线索仅从较早帧流向较晚帧。编辑交叉注意力将编辑请求注入生成。在推理期间,适配器仅在编辑请求到达的块中激活。后续块由原始模型使用重置锚帧生成。此方案在应用编辑的同时保留了原始模型的无限生成能力。大量实验表明,InfinityEdit在每个编辑下忠实延续流,并在无界编辑序列上保持稳定。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:39

论文页面 - InfinityEdit:通过轻量级编辑适配器实现无限视频编辑

来源:https://huggingface.co/papers/2608.20910 作者: 、 、 、 、 、 、 、 、 、

摘要

InfinityEdit通过使用一个带有历史记录、时间因果关系和编辑交叉注意力模块的轻量级适配器,能够将编辑效果扩展到未来的流式帧,同时保持稳定性,从而实现连续、无边界的视频编辑。 借助大型预训练模型,现有方法已有效改进了基于指令的视频编辑。然而,大多数方法依赖于原位编辑假设。它们将编辑后的视频与给定的源片段在固定时间跨度内逐帧对齐。这种模式不适用于开放式流,例如重新设计游戏直播或对正在进行的镜头应用相机运动。在这种情况下,编辑必须在帧到达时就扩展到未来的帧,而不是应用于静态的输入片段。在本文中,我们研究了这种设定,并将其命名为无限视频编辑(https://huggingface.co/papers?q=infinite%20video%20editing):给定一个前置片段和一个编辑请求,模型必须生成下一个片段,该片段在继续流式传输的同时应用请求的编辑。随着无边界的编辑指令序列到来,这个过程会重复进行。该任务带来了两个挑战:编辑必须是忠实的延续,而不是逐帧重写;并且随着编辑的累积,生成质量必须保持稳定。为了解决这些问题,我们首先为无限视频编辑(https://huggingface.co/papers?q=infinite%20video%20editing)设计了一个数据收集流程。基于收集的数据,我们提出了InfinityEdit,一个轻量级的编辑适配器(https://huggingface.co/papers?q=edit%20adapter),它为流式视频生成器(https://huggingface.co/papers?q=streaming%20video%20generator)配备了无边界的编辑能力。该适配器包含三个注意力模块。历史交叉注意力(https://huggingface.co/papers?q=History%20cross-attention)使用输入帧来引导去噪(https://huggingface.co/papers?q=denoising)帧。时间因果自注意力(https://huggingface.co/papers?q=Temporal%20causal%20self-attention)确保时间线索仅从较早的帧流向较晚的帧。编辑交叉注意力(https://huggingface.co/papers?q=Edit%20cross-attention)将编辑请求注入生成过程。在推理期间,适配器仅在接收到编辑请求的那个块中被激活。后续的块则由原始模型在重置锚定帧(https://huggingface.co/papers?q=anchor%20frame)后生成。这种方案在应用编辑的同时,保留了原始模型的无限生成能力。大量实验表明,InfinityEdit在每个编辑下都能忠实延续流,并在无边界的编辑序列中保持稳定。 查看arXiv页面 (https://arxiv.org/abs/2608.20910)查看PDF (https://arxiv.org/pdf/2608.20910)项目页面 (https://yunzetong.github.io/InfinityEdit/)GitHub1 (https://github.com/YunzeTong/InfinityEdit)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.20910) 在你的代理中获取此论文: hf papers read 2608\.20910 没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文 在模型README.md中引用arxiv.org/abs/2608.20910,以从本页面链接它。

引用此论文的数据集0

没有数据集关联此论文 在数据集README.md中引用arxiv.org/abs/2608.20910,以从本页面链接它。

引用此论文的Spaces0

没有Space关联此论文 在Space README.md中引用arxiv.org/abs/2608.20910,以从本页面链接它。

包含此论文的收藏1

相似文章

EditaLive! 用于直播的统一角色视频编辑

Hugging Face Daily Papers

EditaLive是一个用于实时以人为中心的直播视频编辑的新颖框架,它通过因果生成和蒸馏技术来适应图像动画模型,以实现高效的流式推理。

通过上下文稀疏注意力实现闪电般的统一视频编辑

Hugging Face Daily Papers

本文介绍了上下文稀疏注意力(ISA),这是一种通过裁剪冗余上下文和使用动态查询分组来显著降低视频编辑计算成本的框架。作者通过 LIVEditor 证明了该方法的有效性,在多个视频编辑基准测试中实现了近乎无损的加速和最新的技术结果。