一个编辑器,多样编辑:面向多样视频编辑的统一无训练框架
摘要
EditVid是一个统一的无训练视频编辑框架,利用稀疏因果记忆、令牌注入和软潜在混合,支持指令引导和主题引导的编辑,实现高保真并在基准测试中优于基线方法。
查看缓存全文
缓存时间: 2026/09/07 16:17
论文页面 - 一个编辑器,多重编辑:无需训练的统一框架实现多样化视频编辑
来源: https://huggingface.co/papers/2609.04190
摘要
EditVid 是一个无需训练的统一视频编辑框架,它结合了稀疏因果记忆、令牌注入和软潜在混合技术,支持指令引导和主体引导编辑,并保持高保真度。
视频编辑涵盖多种编辑模式,但在单一统一框架内同时实现高质量的指令引导和主体引导编辑(https://huggingface.co/papers?q=subject-guided%20editing)仍然充满挑战。我们提出了 EditVid,一个无需训练的框架,它结合了用于局部一致性的稀疏因果记忆(https://huggingface.co/papers?q=sparse%20causal%20memory)、基于对应关系的后注意力令牌注入(https://huggingface.co/papers?q=correspondence-based%20post-attention%20token%20injection)以保持长程身份一致性,以及软潜在混合(https://huggingface.co/papers?q=soft%20latent%20blending)以确保编辑局部性。同一框架支持指令引导和参考引导编辑,包括风格迁移、属性修改、对象插入、部分级别编辑以及主体替换。在 FiVE 基准测试上,EditVid 达到了 78.16 的 FiVE-Acc(https://huggingface.co/papers?q=FiVE-Acc),而目前评估过的最强无需训练基线仅为 58.95,同时在 IVEBench 上取得了有竞争力的结果。用户研究进一步表明,与7种竞争方法相比,有51.8%的用户整体更倾向于选择 EditVid。
查看 arXiv 页面 (https://arxiv.org/abs/2609.04190) 查看 PDF (https://arxiv.org/pdf/2609.04190) 项目页面 (https://plan-lab.github.io/editvid/) GitHub0 (https://github.com/PLAN-Lab/EditVid) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04190)
通过您的代理获取此论文:
hf papers read 2609.04190
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.04190 以从本页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.04190 以从本页面链接它。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.04190 以从本页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
Uni-Edit:智能编辑是统一模型调优的通用任务
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
EditaLive! 用于直播的统一角色视频编辑
EditaLive是一个用于实时以人为中心的直播视频编辑的新颖框架,它通过因果生成和蒸馏技术来适应图像动画模型,以实现高效的流式推理。
LiveEdit:迈向基于扩散模型的实时流式视频编辑
LiveEdit 提出了一种因果、逐帧的流式视频编辑框架,通过三阶段蒸馏流程和面向增强现实的掩码缓存实现了实时性能(12.66 FPS),从而能够进行稳定的长时编辑。
PermaVid: 通过解耦上下文记忆实现编辑间一致的视频生成
PermaVid 引入了一种多模态上下文记忆,将外观和几何结构解耦,从而在编辑操作后保持长期视频一致性,超越了此前的方法。
InfinityEdit:配备轻量级编辑启动适配器的无限视频编辑
InfinityEdit 提出了一种轻量级适配器,用于无限视频编辑,该适配器通过使用历史、时序和编辑注意力模块,实现对流视频帧的连续编辑,并在无界序列上保持稳定性。