JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑
摘要
JoyAI-Video-Edit 是一个具有 160 亿参数的自回归扩散框架,用于实时、开放式视频编辑,可在单个 NVIDIA B200 GPU 上实现约 30 FPS 的 720p 编辑。
查看缓存全文
缓存时间: 2026/08/05 05:43
论文页面 - JoyAI-Video-Edit: 基于自回归扩散的实时开放式视频编辑
来源: https://huggingface.co/papers/2608.03974
发布于8月4日
#1 当日论文 (https://huggingface.co/papers/date/2026-08-05)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
实时视频编辑需要低延迟的因果生成,在有限的计算资源下保持源保真度和长期时间一致性。我们提出了 JoyAI-Video-Edit——一个 16B 参数的自回归扩散框架,用于实时、开放式视频编辑,无需访问未来帧或预定义视频时长。我们的方法结合了分块自回归适配、源锚定分布匹配蒸馏(SA-DMD)和长程自回归蒸馏,以减少训练-推理不匹配,在两步生成中保持源保真度,并缓解累积的时间漂移。大量自动化和人工评估表明,JoyAI-Video-Edit 显著优于现有的流式编辑器,并在长短视频上与强大的离线系统保持竞争力。完整系统在单个 Nvidia B200 GPU 上实现了约 30 FPS 的端到端 720p 视频编辑。代码可在 https://github.com/jd-opensource/JoyAI-Video-Edit 获取。
查看 arXiv 页面 查看 PDF GitHub40 添加到收藏
在您的代理中获取此论文:
hf papers read 2608\.03974
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
jdopensource/JoyAI-Video-Edit 视频到视频 • 约2小时前更新 • 11 (https://huggingface.co/jdopensource/JoyAI-Video-Edit)
引用此论文的数据集0
没有数据集链接到此论文
在数据集的README.md中引用 arxiv.org/abs/2608.03974 即可从此页面链接到它。
引用此论文的Space0
没有Space链接到此论文
在Space的README.md中引用 arxiv.org/abs/2608.03974 即可从此页面链接到它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集以从此页面链接到它。
相似文章
LiveEdit:迈向基于扩散模型的实时流式视频编辑
LiveEdit 提出了一种因果、逐帧的流式视频编辑框架,通过三阶段蒸馏流程和面向增强现实的掩码缓存实现了实时性能(12.66 FPS),从而能够进行稳定的长时编辑。
jdopensource/JoyAI-Echo
京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。
@AdinaYakup: JD刚刚发布了JoyAI-Echo,一个有趣的长视频生成模型,5分钟多镜头视频生成,跨模态……
JD发布了JoyAI-Echo,这是一个长视频生成模型,能够生成5分钟多镜头视频,具备跨模态记忆实现角色和声音一致性,原生音视频生成,并通过DMD蒸馏技术实现7.5倍速度提升(无质量损失)。
LongE2V: 基于视频扩散模型的长时段事件视频重建、预测与帧插值
LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。