Lip Forcing: 少步自回归扩散实现实时唇形同步
摘要
本文介绍Lip Forcing,首个用于实时视频到视频唇形同步的自回归扩散方法。通过将14B教师模型蒸馏为因果学生模型,并仅使用两步去噪,该方法在1.3B规模下实现了31 FPS的流式处理,比同规模双向模型快17.6倍。
查看缓存全文
缓存时间: 2026/06/10 05:44
论文页面 - Lip Forcing: 少步自回归扩散实现实时唇形同步
来源:https://huggingface.co/papers/2606.11180
摘要
一种用于视频到视频唇形同步的自回归扩散方法,通过蒸馏和优化推理调度实现实时性能。
基于扩散的唇形同步(https://huggingface.co/papers?q=lip%20synchronization)模型虽能获得出色的视觉质量和音视频对齐效果,但全序列双向注意力(https://huggingface.co/papers?q=bidirectional%20attention)和大量去噪步数(https://huggingface.co/papers?q=denoising%20steps)使其难以满足实时推理需求。我们提出 Lip Forcing——据我们所知,这是首个用于视频到视频(V2V)唇形同步(https://huggingface.co/papers?q=lip%20synchronization)的自回归扩散方法——它将一个 14B 参数的条件音频双向视频扩散教师模型蒸馏为因果学生模型(https://huggingface.co/papers?q=causal%20students)。推理时,学生模型仅需两步去噪即可生成每个片段,无需推理时 CFG(https://huggingface.co/papers?q=inference-time%20CFG),从而实现实时唇形同步(https://huggingface.co/papers?q=lip%20synchronization)。一项针对唇形同步的教师轨迹分析揭示了 CFG 的保真度-同步权衡:无 CFG 预测偏向参考保真度,而 CFG 引导预测则在轨迹中期带内偏向同步性。Lip Forcing 将此发现转化为三个基于分析的组件:Sync-Window DMD、两步推理调度和基于 SyncNet(https://huggingface.co/papers?q=SyncNet)的奖励函数。我们在两种学生规模上验证了 Lip Forcing,均从 14B 教师模型蒸馏而来。1.3B 学生模型以 31 FPS 达到实时流式处理,比同等规模的双向模型快 17.6 倍。14B 学生模型(V2V 唇形同步中报道的最大扩散模型)运行速度比其教师模型快 39.8 倍,且参考保真度相当。两种规模的首帧延迟(https://huggingface.co/papers?q=Time-to-first-frame)均低于毫秒级,远低于所有扩散基线。
查看 arXiv 页面(https://arxiv.org/abs/2606.11180)查看 PDF(https://arxiv.org/pdf/2606.11180)项目页面(https://cvlab-kaist.github.io/LipForcing/)GitHub(https://github.com/cvlab-kaist/LipForcing)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.11180)
在你的 agent 中获取此论文:
hf papers read 2606.11180
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.11180 以链接到此页面。
引用此论文的数据集0
暂无数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.11180 以链接到此页面。
引用此论文的 Spaces0
暂无 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.11180 以链接到此页面。
包含此论文的收藏集0
暂无收藏集包含此论文
请将此论文添加至收藏集(https://huggingface.co/new-collection)以链接到此页面。
相似文章
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
Causal Forcing++:可扩展的少步自回归扩散蒸馏,用于实时交互式视频生成
Causal Forcing++提出了一种新颖的因果一致性蒸馏方法,用于逐帧自回归视频生成,在降低延迟和训练成本的同时实现了最先进的质量。
灵活视频扩散(3分钟阅读)
Flex-Forcing提出了一个统一的视频扩散框架,支持自回归和双向生成模式,为视频生成任务提供灵活的控制。
LiveEdit:迈向基于扩散模型的实时流式视频编辑
LiveEdit 提出了一种因果、逐帧的流式视频编辑框架,通过三阶段蒸馏流程和面向增强现实的掩码缓存实现了实时性能(12.66 FPS),从而能够进行稳定的长时编辑。
Causal-rCM: 用于流式视频生成和交互世界模型的自回归扩散蒸馏的统一教师强制与自强制开放方案
本文介绍了Causal-rCM,这是一个统一的教师强制与自强制框架,用于流式视频生成和交互世界模型中的自回归扩散蒸馏,以快速收敛实现了最先进的性能。