AnyTalk:利用视频生成模型为任意角色生成语音动画
摘要
AnyTalk 通过角色特定微调适应视频扩散模型,并优化混合形状参数,无需动画数据即可为任意角色生成 3D 语音动画,并提供实时蒸馏变体。
查看缓存全文
缓存时间: 2026/08/18 07:52
论文页面 - AnyTalk:基于视频生成模型的任意角色语音动画
来源:https://huggingface.co/papers/2608.16143
摘要
AnyTalk通过角色特定微调和优化从合成说话头视频中提取的混合形状参数,能够利用视频扩散模型为任意角色生成无需动画数据的3D语音动画,并提供了用于实时应用的蒸馏版本。
我们提出了AnyTalk,一种无需任何动画数据即可为任意角色生成3D语音动画的新方法。现有的音频驱动3D语音动画方法依赖于特定角色的训练数据或繁琐的骨骼绑定/重新网格化流程,而AnyTalk通过利用在大规模视频数据集上训练的最新视频扩散模型(https://huggingface.co/papers?q=video%20diffusion%20models)来规避这些限制。我们首先通过角色特定微调(Character-specific Fine-tuning,简称CsF)(https://huggingface.co/papers?q=Character-specific%20Fine-tuning%20(CsF))技术,将预训练的视频扩散模型适配到目标角色。通过使用3D角色的渲染图像与表示“无动作”的零值音频嵌入进行微调,我们消除了对动画数据的需求,同时保留了大规模视频扩散模型的运动先验知识。然后,我们通过提出的优化流程(https://huggingface.co/papers?q=optimization%20process)估计混合形状参数(https://huggingface.co/papers?q=blendshape%20parameters),将生成的说话头视频提升为3D语音动画。AnyTalk使得不同面部网格和混合形状配置下的口型同步动画成为可能,显著减少了人工工作量和数据需求。我们进一步通过将AnyTalk蒸馏到一个精简的网络中——AnyTalk_RT——来增强其实用性,从而实现实时性能(https://huggingface.co/papers?q=real-time%20performance)。通过利用说话头视频生成(https://huggingface.co/papers?q=talking-head%20video%20generation),我们的方法扩大了音频驱动语音动画(https://huggingface.co/papers?q=audio-driven%20speech%20animation)技术对任意角色的可及性。代码在以下地址公开:https://serin-yoon.github.io/projects/anytalk/。
查看 arXiv 页面 (https://arxiv.org/abs/2608.16143) 查看 PDF (https://arxiv.org/pdf/2608.16143) 项目页面 (https://serin-yoon.github.io/projects/anytalk/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16143)
在您的代理中获取此论文:
hf papers read 2608.16143
没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash 进行安装。
引用此论文的模型
0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.16143 以从此页面关联。
引用此论文的数据集
0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.16143 以从此页面关联。
引用此论文的 Space
0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.16143 以从此页面关联。
包含此论文的收藏
0
暂无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面关联。
相似文章
LeapTalk: 打破说话头生成中的延迟-质量权衡
LeapTalk 提出了一种新颖的框架,通过单步桥接蒸馏克服了说话头生成中的延迟-质量权衡,实现了高达 200 FPS 的稳定实时生成,并减少了身份漂移。
ARDY: 混合表示的自回归扩散用于交互式人体运动生成
ARDY 引入了一个流式生成框架,用于实时、高保真度的 3D 人体运动生成,通过文本和运动学约束进行控制,采用混合表示和两阶段自回归 Transformer 去噪器。
@HuggingPapers: NVIDIA 刚刚在 Hugging Face 上发布了 AnyFlow 首个任意步数视频扩散模型,可生成高质量文本...
NVIDIA 发布了 AnyFlow,这是首个用于文本到视频生成的任意步数视频扩散模型,允许在推理预算(4 到 50 步)之间实现平滑的质量缩放。
Wan-Animate-2:拓展角色动画模型的应用边界
Wan-Animate-2 是一个全新的端到端角色动画框架,它在重新设计的 Diffusion Transformer 中直接输入驱动视频,实现高保真动作生成和身份保持。它还推出了一个轻量级变体,用于实时流式动画,并已发布开源权重。
Avatar V:可规模化的视频参考虚拟化身视频生成
Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。