SwiftI2V:一种通过条件分段生成实现高效高分辨率图像到视频生成的框架

Hugging Face Daily Papers 论文

摘要

SwiftI2V 是一个新颖的高效框架,用于高分辨率图像到视频的生成,它采用条件分段生成技术,在显著降低计算成本的同时实现了 2K 分辨率的合成。该框架使得在单个消费级或数据中心 GPU 上进行实用的生成成为可能,同时保持了输入的保真度。

高分辨率图像到视频(I2V)生成旨在合成逼真的时间动态,同时保留输入图像的细粒度外观细节。在 2K 分辨率下,这一任务变得极具挑战性,且现有解决方案存在诸多不足:1) 端到端模型在内存和延迟方面往往成本过高;2) 将低分辨率生成与通用视频超分辨率级联使用,由于超分辨率阶段并未显式地以输入图像为条件,容易导致细节幻觉并偏离输入特定的局部结构。为此,我们提出了 SwiftI2V,一个专为高分辨率 I2V 设计的高效框架。遵循广泛使用的两阶段设计思路,该框架通过首先生成低分辨率运动参考来减少 token 消耗并减轻建模负担,随后在以运动引导的强图像条件控制下执行 2K 合成,从而在可控开销下恢复忠实于输入的细节。具体而言,为了提升生成的可扩展性,SwiftI2V 引入了条件分段生成(Conditional Segment-wise Generation, CSG),以有界的每步 token 预算逐段合成视频,并在每个分段内采用双向上下文交互以提高跨分段的一致性和输入保真度。在 2K 分辨率下的 VBench-I2V 基准测试中,SwiftI2V 实现了与端到端基线模型相当的性能,同时将总 GPU 时间减少了 202 倍。特别是,它使得在单个数据中心 GPU(如 H800)或消费级 GPU(如 RTX 4090)上进行实用的 2K I2V 生成成为可能。
查看原文
查看缓存全文

缓存时间: 2026/05/08 07:10

论文页面 - SwiftI2V:通过条件分段生成实现高效的超高分辨率图像到视频生成

来源:https://huggingface.co/papers/2605.06356

摘要

SwiftI2V 是一个高效的超高分辨率图像到视频生成框架,它利用条件分段生成和双向上下文交互,以较低的算力需求实现可扩展且忠实于输入的视频合成。

超高分辨率 (https://huggingface.co/papers?q=High-resolution) 图像到视频 (I2V) 生成旨在在保留输入图像细粒度外观细节的同时合成逼真的时间动态。在 2K 分辨率下,这一任务极具挑战性,且现有解决方案存在各种弱点:1) 端到端模型在内存和延迟方面通常过于昂贵;2) 将低分辨率生成与通用视频超分辨率级联往往会导致细节幻觉并偏离输入特定的局部结构,因为超分辨率阶段并未明确以输入图像为条件。为此,我们提出了 SwiftI2V,这是一个专为超高分辨率 (https://huggingface.co/papers?q=high-resolution) I2V 设计的高效框架。遵循广泛使用的两阶段设计,它首先生成低分辨率运动参考以降低 Token 成本并减轻建模负担,然后在运动引导下执行强图像条件的 2K 合成,以控制开销并恢复忠实于输入的细粒度细节。具体而言,为了使生成更具可扩展性,SwiftI2V 引入了条件分段生成 (https://huggingface.co/papers?q=Conditional%20Segment-wise%20Generation) (CSG),在有限的每步 Token 预算 (https://huggingface.co/papers?q=token%20budget) 下逐段合成视频,并在每个分段内采用双向上下文交互 (https://huggingface.co/papers?q=bidirectional%20contextual%20interaction) 以改善跨分段连贯性 (https://huggingface.co/papers?q=cross-segment%20coherence) 和输入忠实度 (https://huggingface.co/papers?q=input%20fidelity)。在 2K 分辨率的 VBench-I2V 上,SwiftI2V 实现了与端到端基线模型相当的性能,同时将总 GPU 时间减少了 202 倍。特别是,它使得在单个数据中心 GPU (如 H800) 或消费级 GPU (如 RTX 4090) 上进行实用的 2K I2V 生成成为可能。

查看 arXiv 页面 (https://arxiv.org/abs/2605.06356) 查看 PDF (https://arxiv.org/pdf/2605.06356) 项目页面 (https://hkust-longgroup.github.io/SwiftI2V/) GitHub (https://github.com/HKUST-LongGroup/SwiftI2V) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.06356)

在您的智能代理中获取此论文:

hf papers read 2605\.06356

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2605.06356 即可从此页面链接它。

引用此论文的数据集 0

没有链接此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2605.06356 即可从此页面链接它。

引用此论文的 Space 0

没有链接此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2605.06356 即可从此页面链接它。

包含此论文的收藏集 0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接它。

相似文章

SwiftVR:实时一步生成式视频修复

Hugging Face Daily Papers

SwiftVR 是一个实时的一步生成式视频修复框架,利用高效注意力机制和轻量级修复感知自编码器,在消费级 GPU 上实现了高帧率。

ID-V2V:身份保留的视频重风格化

Hugging Face Daily Papers

ID-V2V 是一个用于身份保留视频重风格化的视频到视频生成框架。它将身份保留视为视频重光照问题,并使用编辑后的关键帧进行风格传播,无需配对训练数据即可实现高质量结果。

Nvidia 的新型长视频生成技术(12分钟阅读)

TLDR AI

NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。

使用 Veo 2 和 Imagen 3 进行最先进的视频和图像生成

Google DeepMind Blog

Google 推出了 Veo 2 和 Imagen 3,这些最先进的视频和图像生成模型现已在 VideoFX、ImageFX 和一个名为 Whisk 的新工具中推出。Veo 2 能够生成高质量的 4K 视频,具有改进的物理理解和电影摄影知识,而 Imagen 3 则能够生成更亮丽、构图更佳的图像,并支持多种艺术风格。