LoomVideo:统一多模态输入的视频生成与编辑

Hugging Face Daily Papers 论文

摘要

LoomVideo提出了一种5B参数的统一架构用于视频生成和编辑,通过新颖的条件机制和多模态对齐减少计算开销,实现了具有竞争力的性能和更快的推理速度。

开发能够解读交错多模态输入的统一视频生成与编辑模型是一个有前景但具有挑战性的前沿领域。现有的统一框架主要依赖大规模模型(通常为13B参数或更多),并通过拼接序列令牌的方式将源视频条件融入编辑过程中。这种拼接不可避免地使序列长度加倍,导致自注意力机制的计算复杂度翻两番,带来高昂的开销。为解决这些瓶颈,我们提出了LoomVideo,一个高效的5B参数统一架构,用于视频生成与编辑。LoomVideo用多模态大语言模型(MLLM)替代了标准文本编码器,并采用Deepstack注入机制来对齐多层MLLM特征与扩散变换器(DiT)。关键的是,我们引入了一种零开销的Scale-and-Add条件方法用于视频编辑。通过缩放并直接将干净源视频潜在表示添加到噪声目标潜在表示中,这一优雅设计消除了令牌拼接的需求,大幅降低计算成本,同时保持对复杂非刚性编辑的稳健能力。此外,无缝集成了负时间RoPE策略以处理多个参考图像。大量实验表明,我们紧凑的5B模型在全面基准测试中实现了最先进或极具竞争力的性能,在电商和时尚生成场景中表现出卓越优势。得益于零开销条件机制,LoomVideo相比能力相似的模型实现了至少5.41倍的推理速度提升,为高度实用且高效的视频基础模型铺平了道路。
查看原文
查看缓存全文

缓存时间: 2026/06/05 06:07

论文页面 - LoomVideo:融合多模态输入于视频生成与编辑

来源:https://huggingface.co/papers/2606.06042 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

LoomVideo 提出了一种高效的 5B 参数统一架构,用于视频生成与编辑,通过新颖的条件调控机制和多模态对齐技术降低了计算开销。

开发能够解读交错多模态输入的统一视频生成与编辑模型,是一个前景广阔但极具挑战的前沿领域。现有统一框架主要依赖大规模模型(通常为 13B 参数或更多),并通过拼接序列 token 的方式将源视频条件引入编辑过程。这种拼接不可避免地使序列长度翻倍,导致自注意力机制的计算复杂度增加四倍,并带来高昂的开销。为解决这些瓶颈,我们提出了 LoomVideo——一个高效的 5B 参数统一架构,同时支持视频生成与编辑。LoomVideo 用多模态大语言模型替换了标准文本编码器,并采用深度堆叠注入机制将多层级 MLLM 特征与扩散 Transformer 对齐。关键在于,我们引入了一种零开销的缩放加法条件调控方法用于视频编辑。通过将干净的源视频潜变量缩放后直接添加到带噪的目标潜变量中,这种精巧的设计省去了 token 拼接,大幅降低了计算成本,同时保持了对复杂非刚性编辑的鲁棒能力。此外,一种负时间 RoPE 策略被无缝集成,以处理多张参考图像。大量实验表明,我们紧凑的 5B 模型在综合基准测试中达到了最优或极具竞争力的性能,在电商和时尚生成场景中展现出卓越优势。受益于零开销条件机制,LoomVideo 相比同类能力模型实现了至少 5.41 倍的推理加速,为构建实用高效的视频基础模型铺平了道路。

查看 arXiv 页面 (https://arxiv.org/abs/2606.06042) 查看 PDF (https://arxiv.org/pdf/2606.06042) 项目页面 (https://msalab-pku.github.io/projects/LoomVideo/index.html) GitHub3 (https://github.com/MSALab-PKU/LoomVideo) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06042)

引用此论文的模型 1

MSALab/LoomVideo 更新于约 3 小时前 (https://huggingface.co/MSALab/LoomVideo)

引用此论文的数据集 0

暂无数据集链接此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2606.06042 以便从此页面链接。

引用此论文的 Space 0

暂无 Space 链接此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2606.06042 以便从此页面链接。

包含此论文的合集 0

暂无合集包含此论文

请将此论文添加到收藏 (https://huggingface.co/new-collection) 以便从此页面链接。

相似文章

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。

Video2LoRA: 视觉-语言模型的参数化视频内化

Hugging Face Daily Papers

本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。