Lip Forcing: 少步自回归扩散实现实时唇形同步

Hugging Face Daily Papers 论文

摘要

本文介绍Lip Forcing,首个用于实时视频到视频唇形同步的自回归扩散方法。通过将14B教师模型蒸馏为因果学生模型,并仅使用两步去噪,该方法在1.3B规模下实现了31 FPS的流式处理,比同规模双向模型快17.6倍。

基于扩散的唇形同步模型实现了强视觉质量和音视频对齐,但全序列双向注意力和大量去噪步骤使其不适用于实时推理。我们提出Lip Forcing——据我们所知,首个用于视频到视频(V2V)唇形同步的自回归扩散方法——该方法将14B音频条件双向视频扩散教师模型蒸馏为因果学生模型。推理时,学生模型仅用两步去噪即可生成每个块,无需推理时的CFG,从而实现实时唇形同步。一项针对唇形同步的教师轨迹分析揭示了CFG保真度与同步性的权衡:无CFG预测倾向于参考保真度,而CFG引导的预测则倾向于中轨迹带内的同步性。Lip Forcing将此发现转化为三个分析驱动的组件:Sync-Window DMD、两步推理调度和基于SyncNet的奖励。我们在两个学生规模上验证了Lip Forcing,两者均蒸馏自14B教师模型。1.3B学生模型实现了31 FPS的实时流式处理,比同规模双向模型快17.6倍。14B学生模型——据报告是V2V唇形同步中最大的扩散模型——在可比的参考保真度下,比其教师模型快39.8倍。两种规模的首帧时间均低于亚毫秒,远低于所有扩散基线。
查看原文
查看缓存全文

缓存时间: 2026/06/10 05:44

论文页面 - Lip Forcing: 少步自回归扩散实现实时唇形同步

来源:https://huggingface.co/papers/2606.11180

摘要

一种用于视频到视频唇形同步的自回归扩散方法,通过蒸馏和优化推理调度实现实时性能。

基于扩散的唇形同步(https://huggingface.co/papers?q=lip%20synchronization)模型虽能获得出色的视觉质量和音视频对齐效果,但全序列双向注意力(https://huggingface.co/papers?q=bidirectional%20attention)和大量去噪步数(https://huggingface.co/papers?q=denoising%20steps)使其难以满足实时推理需求。我们提出 Lip Forcing——据我们所知,这是首个用于视频到视频(V2V)唇形同步(https://huggingface.co/papers?q=lip%20synchronization)的自回归扩散方法——它将一个 14B 参数的条件音频双向视频扩散教师模型蒸馏为因果学生模型(https://huggingface.co/papers?q=causal%20students)。推理时,学生模型仅需两步去噪即可生成每个片段,无需推理时 CFG(https://huggingface.co/papers?q=inference-time%20CFG),从而实现实时唇形同步(https://huggingface.co/papers?q=lip%20synchronization)。一项针对唇形同步的教师轨迹分析揭示了 CFG 的保真度-同步权衡:无 CFG 预测偏向参考保真度,而 CFG 引导预测则在轨迹中期带内偏向同步性。Lip Forcing 将此发现转化为三个基于分析的组件:Sync-Window DMD、两步推理调度和基于 SyncNet(https://huggingface.co/papers?q=SyncNet)的奖励函数。我们在两种学生规模上验证了 Lip Forcing,均从 14B 教师模型蒸馏而来。1.3B 学生模型以 31 FPS 达到实时流式处理,比同等规模的双向模型快 17.6 倍。14B 学生模型(V2V 唇形同步中报道的最大扩散模型)运行速度比其教师模型快 39.8 倍,且参考保真度相当。两种规模的首帧延迟(https://huggingface.co/papers?q=Time-to-first-frame)均低于毫秒级,远低于所有扩散基线。

查看 arXiv 页面(https://arxiv.org/abs/2606.11180)查看 PDF(https://arxiv.org/pdf/2606.11180)项目页面(https://cvlab-kaist.github.io/LipForcing/)GitHub(https://github.com/cvlab-kaist/LipForcing)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.11180)

在你的 agent 中获取此论文:

hf papers read 2606.11180

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型链接到此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.11180 以链接到此页面。

引用此论文的数据集0

暂无数据集链接到此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.11180 以链接到此页面。

引用此论文的 Spaces0

暂无 Space 链接到此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.11180 以链接到此页面。

包含此论文的收藏集0

暂无收藏集包含此论文

请将此论文添加至收藏集(https://huggingface.co/new-collection)以链接到此页面。

相似文章

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。

灵活视频扩散(3分钟阅读)

TLDR AI

Flex-Forcing提出了一个统一的视频扩散框架,支持自回归和双向生成模式,为视频生成任务提供灵活的控制。