一个编辑器,多样编辑:面向多样视频编辑的统一无训练框架

Hugging Face Daily Papers 论文

摘要

EditVid是一个统一的无训练视频编辑框架,利用稀疏因果记忆、令牌注入和软潜在混合,支持指令引导和主题引导的编辑,实现高保真并在基准测试中优于基线方法。

视频编辑涵盖多种编辑范式,但在单一统一框架内实现高质量的指令引导和主题引导编辑仍具挑战性。我们提出EditVid,一个无训练框架,结合稀疏因果记忆以保持局部一致性、基于对应关系的后注意力令牌注入以保持长程身份、以及软潜在混合以控制编辑局部性。该框架支持指令引导和参考引导编辑,包括风格转移、属性修改、对象插入、部分级别编辑和主题替换。在FiVE上,EditVid达到78.16 FiVE-Acc,而最强评估的无训练基线为58.95,同时在IVEBench上获得竞争性结果。用户研究进一步显示,EditVid在7种竞争方法中获得51.8\%的整体偏好。
查看原文
查看缓存全文

缓存时间: 2026/09/07 16:17

论文页面 - 一个编辑器,多重编辑:无需训练的统一框架实现多样化视频编辑

来源: https://huggingface.co/papers/2609.04190

摘要

EditVid 是一个无需训练的统一视频编辑框架,它结合了稀疏因果记忆、令牌注入和软潜在混合技术,支持指令引导和主体引导编辑,并保持高保真度。

视频编辑涵盖多种编辑模式,但在单一统一框架内同时实现高质量的指令引导和主体引导编辑(https://huggingface.co/papers?q=subject-guided%20editing)仍然充满挑战。我们提出了 EditVid,一个无需训练的框架,它结合了用于局部一致性的稀疏因果记忆(https://huggingface.co/papers?q=sparse%20causal%20memory)、基于对应关系的后注意力令牌注入(https://huggingface.co/papers?q=correspondence-based%20post-attention%20token%20injection)以保持长程身份一致性,以及软潜在混合(https://huggingface.co/papers?q=soft%20latent%20blending)以确保编辑局部性。同一框架支持指令引导和参考引导编辑,包括风格迁移、属性修改、对象插入、部分级别编辑以及主体替换。在 FiVE 基准测试上,EditVid 达到了 78.16 的 FiVE-Acc(https://huggingface.co/papers?q=FiVE-Acc),而目前评估过的最强无需训练基线仅为 58.95,同时在 IVEBench 上取得了有竞争力的结果。用户研究进一步表明,与7种竞争方法相比,有51.8%的用户整体更倾向于选择 EditVid。

查看 arXiv 页面 (https://arxiv.org/abs/2609.04190) 查看 PDF (https://arxiv.org/pdf/2609.04190) 项目页面 (https://plan-lab.github.io/editvid/) GitHub0 (https://github.com/PLAN-Lab/EditVid) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04190)

通过您的代理获取此论文:

hf papers read 2609.04190

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.04190 以从本页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.04190 以从本页面链接它。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2609.04190 以从本页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

EditaLive! 用于直播的统一角色视频编辑

Hugging Face Daily Papers

EditaLive是一个用于实时以人为中心的直播视频编辑的新颖框架,它通过因果生成和蒸馏技术来适应图像动画模型,以实现高效的流式推理。