JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

Hugging Face Daily Papers 论文

摘要

JoyAI-Video-Edit 是一个具有 160 亿参数的自回归扩散框架,用于实时、开放式视频编辑,可在单个 NVIDIA B200 GPU 上实现约 30 FPS 的 720p 编辑。

实时视频编辑需要在有限计算资源下实现低延迟的因果生成,同时保持源视频保真度和长期时间一致性。我们提出了 JoyAI-Video-Edit,一个具有 160 亿参数的自回归扩散框架,用于无需访问未来帧或预先定义视频时长的实时开放式视频编辑。我们的方法结合了逐块自回归自适应、源锚定分布匹配蒸馏(SA-DMD)和长视界自回归蒸馏,以减少训练与推理之间的不匹配、在两步生成过程中保持源视频保真度,并缓解累积的时间漂移。大量自动化和人工评估表明,JoyAI-Video-Edit 在短视频和长视频上均显著优于现有的流式编辑系统,并且与强大的离线系统相比仍具有竞争力。整个系统可在单个 Nvidia B200 GPU 上以约 30 FPS 的速度实现端到端 720p 视频编辑。代码可在 https://github.com/jd-opensource/JoyAI-Video-Edit 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:43

论文页面 - JoyAI-Video-Edit: 基于自回归扩散的实时开放式视频编辑

来源: https://huggingface.co/papers/2608.03974

发布于8月4日

#1 当日论文 (https://huggingface.co/papers/date/2026-08-05)

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

实时视频编辑需要低延迟的因果生成,在有限的计算资源下保持源保真度和长期时间一致性。我们提出了 JoyAI-Video-Edit——一个 16B 参数的自回归扩散框架,用于实时、开放式视频编辑,无需访问未来帧或预定义视频时长。我们的方法结合了分块自回归适配、源锚定分布匹配蒸馏(SA-DMD)和长程自回归蒸馏,以减少训练-推理不匹配,在两步生成中保持源保真度,并缓解累积的时间漂移。大量自动化和人工评估表明,JoyAI-Video-Edit 显著优于现有的流式编辑器,并在长短视频上与强大的离线系统保持竞争力。完整系统在单个 Nvidia B200 GPU 上实现了约 30 FPS 的端到端 720p 视频编辑。代码可在 https://github.com/jd-opensource/JoyAI-Video-Edit 获取。

查看 arXiv 页面 查看 PDF GitHub40 添加到收藏

在您的代理中获取此论文:

hf papers read 2608\.03974

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

jdopensource/JoyAI-Video-Edit 视频到视频 • 约2小时前更新 • 11 (https://huggingface.co/jdopensource/JoyAI-Video-Edit)

引用此论文的数据集0

没有数据集链接到此论文

在数据集的README.md中引用 arxiv.org/abs/2608.03974 即可从此页面链接到它。

引用此论文的Space0

没有Space链接到此论文

在Space的README.md中引用 arxiv.org/abs/2608.03974 即可从此页面链接到它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集以从此页面链接到它。

相似文章

jdopensource/JoyAI-Echo

Hugging Face Models Trending

京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。