LoomVideo:统一多模态输入的视频生成与编辑
摘要
LoomVideo提出了一种5B参数的统一架构用于视频生成和编辑,通过新颖的条件机制和多模态对齐减少计算开销,实现了具有竞争力的性能和更快的推理速度。
查看缓存全文
缓存时间: 2026/06/05 06:07
论文页面 - LoomVideo:融合多模态输入于视频生成与编辑
来源:https://huggingface.co/papers/2606.06042 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
LoomVideo 提出了一种高效的 5B 参数统一架构,用于视频生成与编辑,通过新颖的条件调控机制和多模态对齐技术降低了计算开销。
开发能够解读交错多模态输入的统一视频生成与编辑模型,是一个前景广阔但极具挑战的前沿领域。现有统一框架主要依赖大规模模型(通常为 13B 参数或更多),并通过拼接序列 token 的方式将源视频条件引入编辑过程。这种拼接不可避免地使序列长度翻倍,导致自注意力机制的计算复杂度增加四倍,并带来高昂的开销。为解决这些瓶颈,我们提出了 LoomVideo——一个高效的 5B 参数统一架构,同时支持视频生成与编辑。LoomVideo 用多模态大语言模型替换了标准文本编码器,并采用深度堆叠注入机制将多层级 MLLM 特征与扩散 Transformer 对齐。关键在于,我们引入了一种零开销的缩放加法条件调控方法用于视频编辑。通过将干净的源视频潜变量缩放后直接添加到带噪的目标潜变量中,这种精巧的设计省去了 token 拼接,大幅降低了计算成本,同时保持了对复杂非刚性编辑的鲁棒能力。此外,一种负时间 RoPE 策略被无缝集成,以处理多张参考图像。大量实验表明,我们紧凑的 5B 模型在综合基准测试中达到了最优或极具竞争力的性能,在电商和时尚生成场景中展现出卓越优势。受益于零开销条件机制,LoomVideo 相比同类能力模型实现了至少 5.41 倍的推理加速,为构建实用高效的视频基础模型铺平了道路。
查看 arXiv 页面 (https://arxiv.org/abs/2606.06042) 查看 PDF (https://arxiv.org/pdf/2606.06042) 项目页面 (https://msalab-pku.github.io/projects/LoomVideo/index.html) GitHub3 (https://github.com/MSALab-PKU/LoomVideo) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06042)
引用此论文的模型 1
MSALab/LoomVideo 更新于约 3 小时前 (https://huggingface.co/MSALab/LoomVideo)
引用此论文的数据集 0
暂无数据集链接此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2606.06042 以便从此页面链接。
引用此论文的 Space 0
暂无 Space 链接此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2606.06042 以便从此页面链接。
包含此论文的合集 0
暂无合集包含此论文
请将此论文添加到收藏 (https://huggingface.co/new-collection) 以便从此页面链接。
相似文章
UniVidX:基于扩散先验的多功能视频生成统一多模态框架
本文介绍了 UniVidX 论文,该论文提出了一种利用扩散先验进行视频生成的统一多模态框架,并讨论了其跨模态一致性机制。
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。
Video2LoRA: 视觉-语言模型的参数化视频内化
本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。
Light-Omni:带长期记忆的智能体视频理解中反射优先于推理
Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。
LoMo: 局部模态替换以实现更深层的视觉-语言融合
LoMo 提出了一种数据整理方法,将单模态提示重新表述为交错的多模态序列,以改善视觉-语言模型中的跨模态表示对齐,在多个基准测试上取得了持续的性能提升。