EditaLive! 用于直播的统一角色视频编辑

Hugging Face Daily Papers 论文

摘要

EditaLive是一个用于实时以人为中心的直播视频编辑的新颖框架,它通过因果生成和蒸馏技术来适应图像动画模型,以实现高效的流式推理。

传统视频编辑主要关注场景级内容,而直播则更强调人物主体。然而,将现有的视频编辑方法直接应用于以人为中心的直播仍然具有挑战性,因为它们可能引入面部表情不一致,并且通常依赖于多个离线推理步骤,使其不适合实时交互。我们提出了EditaLive,一个用于实时流式角色视频编辑的新颖框架。具体而言,我们从一个预训练的图像动画模型(Wan-Animate)出发,该模型自然地将外观与运动解耦,并通过收集的CharEdit-50K数据集,通过参考帧编辑和视频重建,将其重新用作基于指令的以人为中心的视频编辑的基础模型。此外,我们将模型从离线双向适应为因果流式生成,并设计了一个对齐的自展开蒸馏策略,将模型压缩为两步采样器,其中固定的RoPE和对齐强制减少了训练与推理的差异,并且第一帧保留的稀疏注意力过滤冗余历史信息以缓解外观漂移。大量实验表明,EditaLive提供了最先进的编辑性能,忠实保留了面部表情,并具有低延迟的实时流式推理能力。
查看原文
查看缓存全文

缓存时间: 2026/08/28 15:26

论文页面 - EditaLive!面向直播的统一角色视频编辑

来源:https://huggingface.co/papers/2608.27123

摘要

EditaLive 通过适配图像动画模型,采用蒸馏两步采样与稀疏注意力实现因果流式生成,从而实现以人为中心的实时直播视频编辑。

传统视频编辑主要关注场景级内容,而直播更强调人物主体。然而,直接将现有视频编辑方法应用于以人为中心的直播仍具挑战性,因其可能导致面部表情不一致,且通常依赖多个离线推理步骤,不适合实时交互。我们提出 EditaLive,这是一个用于实时流式角色视频编辑的新型框架。具体而言,我们从预训练的图像动画模型(https://huggingface.co/papers?q=image%20animation%20model)(WanAnimate(https://huggingface.co/papers?q=Wan-Animate))出发,该模型自然解耦外观与运动,我们通过参考帧编辑和视频重建,利用收集到的 CharEdit-50K(https://huggingface.co/papers?q=CharEdit-50K)数据集,将其重新用作基于指令的以人为中心视频编辑的基础模型。此外,我们将模型从离线双向适配为因果流式生成(https://huggingface.co/papers?q=causal%20streaming%20generation),并设计了一种对齐的自展开蒸馏(https://huggingface.co/papers?q=self-rollout%20distillation)策略,将模型压缩为两步采样器(https://huggingface.co/papers?q=two-step%20sampler),其中固定的 RoPE(https://huggingface.co/papers?q=RoPE)和对齐强制减少了训练-推理差异,而保留首帧的稀疏注意力(https://huggingface.co/papers?q=sparse%20attention)过滤了冗余的历史信息,以缓解外观漂移(https://huggingface.co/papers?q=appearance%20drift)。大量实验表明,EditaLive 实现了最先进的编辑性能,忠实地保留面部表情,并支持低延迟实时流式推理。

查看 arXiv 页面 (https://arxiv.org/abs/2608.27123)查看 PDF (https://arxiv.org/pdf/2608.27123)项目页面 (https://huai-chang.github.io/EditaLive/)GitHub (https://github.com/GVCLab/EditaLive)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.27123)

在你的代理中获取这篇论文:

hf papers read 2608\.27123

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2608.27123 以将其链接到此页面。

引用本文的数据集 0

无数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2608.27123 以将其链接到此页面。

引用本文的空间 0

无空间链接本文

在空间的 README.md 中引用 arxiv.org/abs/2608.27123 以将其链接到此页面。

包含本文的收藏夹 0

无收藏夹包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection)以将其链接到此页面。

相似文章

LiveAnimate:实时稳定长时流式人体动画

Hugging Face Daily Papers

LiveAnimate 提出了一个14B参数的视频扩散Transformer,通过PR-Sink注意力机制实现了实时、长时、姿态驱动的人体动画,具有稳定流式生成和恒定内存占用。在两个H100 GPU上实现了19.63 FPS的推理速度,在长达三分钟的流中保持质量。