CineMobile:用于电影级摄像机运动生成的设备端图像到视频扩散
摘要
本文介绍了CineMobile,一种高效的设备端图像到视频生成方法,通过蒸馏引导剪枝、扩散蒸馏和混合量化,相较于教师模型实现了40倍加速,使得在移动设备上实现电影级摄影机运动效果成为可能。
查看缓存全文
缓存时间: 2026/07/10 06:16
论文页面 - CineMobile:面向电影级镜头运动的端侧图像到视频扩散模型
来源:https://huggingface.co/papers/2607.03803
摘要
CineMobile 通过蒸馏引导剪枝、扩散蒸馏和混合量化技术,在保持视觉质量的同时实现显著加速,从而在移动设备上实现高效的图像到视频生成。
移动设备上图像到视频创作的需求日益增长,越来越关注电影级运动效果,如子弹时间、推拉变焦、慢动作等。虽然扩散变换器(DiTs)在视频生成方面表现出色,但其庞大的参数量和多步迭代去噪过程导致巨大的计算开销,使得在移动设备上高效生成成为挑战。我们提出 CineMobile 来弥合这一差距。具体而言,CineMobile 采用三重优化策略:(1)利用蒸馏引导剪枝方法,得到一个紧凑而高效的模型,保留电影效果所需的基本视频生成能力;(2)通过结合扩散蒸馏和强化学习将压缩模型优化为 4 步生成器;(3)采用混合训练后量化策略,将模型占用空间压缩至 1 GB 以下。实验结果表明,与基于 Wan 2.1 架构的教师模型相比,CineMobile 在保持相当视觉质量的同时,实现了 40 倍的生成加速。具体来说,CineMobile 生成 49 帧 480p 视频时,在 NVIDIA H200 GPU 上每步去噪延迟为 0.6 秒,在 MediaTek Dimensity 8400 Ultimate 5G 平台上为 20 秒,峰值内存占用为 1.8 GB,展示了其在移动端图像到视频创作中的实际应用潜力。
查看 arXiv 页面 (https://arxiv.org/abs/2607.03803) 查看 PDF (https://arxiv.org/pdf/2607.03803) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.03803)
在您的智能体中获取此论文:
hf papers read 2607\.03803
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.03803 以从本页链接。
引用此论文的数据集 0
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.03803 以从本页链接。
引用此论文的 Space 0
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.03803 以从本页链接。
包含此论文的收藏集 0
暂无收藏集包含此论文
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
Dynamic-in-Few-Step: 统一动态计算与少步蒸馏的高效视频生成
本文提出了一种针对视频扩散模型的后训练加速框架,将动态结构稀疏化与少步蒸馏相结合,在保持生成质量的同时实现了显著加速。
ReImagine:以图像为先的可控高质量人体视频生成新思路
ReImagine 提出“图像优先”的可控高质量人体视频生成方案,借助 SMPL-X 动作引导与视频扩散模型,将外观建模与时间一致性解耦。
视频扩散模型在手部运动重建中的惊人有效性
ViDiHand 利用预训练的视频扩散模型表示,直接从自我中心视频帧中重建4D手部运动,无需检测器或优化,在ARCTIC、HOT3D和HOI4D上优于现有方法。
SANA-Video:基于块线性扩散变压器的高效视频生成
SANA-Video是一个小型扩散模型,利用线性注意力和恒定内存KV缓存,高效生成高分辨率、长时长的视频,以显著更低的成本和更快的速度实现与现有模型相媲美的性能。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。