标签
ID-V2V 是一个用于身份保留视频重风格化的视频到视频生成框架。它将身份保留视为视频重光照问题,并使用编辑后的关键帧进行风格传播,无需配对训练数据即可实现高质量结果。
本文介绍Lip Forcing,首个用于实时视频到视频唇形同步的自回归扩散方法。通过将14B教师模型蒸馏为因果学生模型,并仅使用两步去噪,该方法在1.3B规模下实现了31 FPS的流式处理,比同规模双向模型快17.6倍。
SANA Streaming 支持在单张NVIDIA RTX 5090 GPU上进行视频到视频生成。