EditaLive! 用于直播的统一角色视频编辑
摘要
EditaLive是一个用于实时以人为中心的直播视频编辑的新颖框架,它通过因果生成和蒸馏技术来适应图像动画模型,以实现高效的流式推理。
查看缓存全文
缓存时间: 2026/08/28 15:26
论文页面 - EditaLive!面向直播的统一角色视频编辑
来源:https://huggingface.co/papers/2608.27123
摘要
EditaLive 通过适配图像动画模型,采用蒸馏两步采样与稀疏注意力实现因果流式生成,从而实现以人为中心的实时直播视频编辑。
传统视频编辑主要关注场景级内容,而直播更强调人物主体。然而,直接将现有视频编辑方法应用于以人为中心的直播仍具挑战性,因其可能导致面部表情不一致,且通常依赖多个离线推理步骤,不适合实时交互。我们提出 EditaLive,这是一个用于实时流式角色视频编辑的新型框架。具体而言,我们从预训练的图像动画模型(https://huggingface.co/papers?q=image%20animation%20model)(WanAnimate(https://huggingface.co/papers?q=Wan-Animate))出发,该模型自然解耦外观与运动,我们通过参考帧编辑和视频重建,利用收集到的 CharEdit-50K(https://huggingface.co/papers?q=CharEdit-50K)数据集,将其重新用作基于指令的以人为中心视频编辑的基础模型。此外,我们将模型从离线双向适配为因果流式生成(https://huggingface.co/papers?q=causal%20streaming%20generation),并设计了一种对齐的自展开蒸馏(https://huggingface.co/papers?q=self-rollout%20distillation)策略,将模型压缩为两步采样器(https://huggingface.co/papers?q=two-step%20sampler),其中固定的 RoPE(https://huggingface.co/papers?q=RoPE)和对齐强制减少了训练-推理差异,而保留首帧的稀疏注意力(https://huggingface.co/papers?q=sparse%20attention)过滤了冗余的历史信息,以缓解外观漂移(https://huggingface.co/papers?q=appearance%20drift)。大量实验表明,EditaLive 实现了最先进的编辑性能,忠实地保留面部表情,并支持低延迟实时流式推理。
查看 arXiv 页面 (https://arxiv.org/abs/2608.27123)查看 PDF (https://arxiv.org/pdf/2608.27123)项目页面 (https://huai-chang.github.io/EditaLive/)GitHub (https://github.com/GVCLab/EditaLive)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.27123)
在你的代理中获取这篇论文:
hf papers read 2608\.27123
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2608.27123 以将其链接到此页面。
引用本文的数据集 0
无数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2608.27123 以将其链接到此页面。
引用本文的空间 0
无空间链接本文
在空间的 README.md 中引用 arxiv.org/abs/2608.27123 以将其链接到此页面。
包含本文的收藏夹 0
无收藏夹包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection)以将其链接到此页面。
相似文章
LiveEdit:迈向基于扩散模型的实时流式视频编辑
LiveEdit 提出了一种因果、逐帧的流式视频编辑框架,通过三阶段蒸馏流程和面向增强现实的掩码缓存实现了实时性能(12.66 FPS),从而能够进行稳定的长时编辑。
InfinityEdit:配备轻量级编辑启动适配器的无限视频编辑
InfinityEdit 提出了一种轻量级适配器,用于无限视频编辑,该适配器通过使用历史、时序和编辑注意力模块,实现对流视频帧的连续编辑,并在无界序列上保持稳定性。
JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑
JoyAI-Video-Edit 是一个具有 160 亿参数的自回归扩散框架,用于实时、开放式视频编辑,可在单个 NVIDIA B200 GPU 上实现约 30 FPS 的 720p 编辑。
PersonaLive!用于直播的生动肖像图像动画
PersonaLive 是一个基于扩散模型的框架,用于直播中的实时生动肖像动画,通过混合隐式信号和自回归流式生成实现了显著的速度提升。
LiveAnimate:实时稳定长时流式人体动画
LiveAnimate 提出了一个14B参数的视频扩散Transformer,通过PR-Sink注意力机制实现了实时、长时、姿态驱动的人体动画,具有稳定流式生成和恒定内存占用。在两个H100 GPU上实现了19.63 FPS的推理速度,在长达三分钟的流中保持质量。