AnyTalk:利用视频生成模型为任意角色生成语音动画

Hugging Face Daily Papers 论文

摘要

AnyTalk 通过角色特定微调适应视频扩散模型,并优化混合形状参数,无需动画数据即可为任意角色生成 3D 语音动画,并提供实时蒸馏变体。

我们提出 AnyTalk,这是一种为任意角色生成 3D 语音动画的新方法,无需任何动画数据。虽然现有的音频驱动 3D 语音动画方法依赖于角色特定的训练数据或繁琐的绑定/重新网格化,但 AnyTalk 通过利用在大规模视频数据集上训练的最新视频扩散模型来绕过这些限制。我们首先通过角色特定微调(CsF)技术将预训练的视频扩散模型适应到目标角色。通过使用 3D 角色的渲染图像与零音频嵌入(表示“无运动”)配对进行微调,我们消除了对动画数据的需求,同时保留了大规模视频扩散模型的运动先验。然后,我们通过提出的优化过程估计混合形状参数,将生成的说话头部视频提升为 3D 语音动画。AnyTalk 能够为不同的面部网格和混合形状配置实现唇形同步动画,显著减少了手动工作和数据需求。我们进一步通过将 AnyTalk 蒸馏为精简网络 AnyTalk_{RT} 来增强可用性,从而实现实时性能。通过利用说话头部视频生成,我们的方法为任意角色的音频驱动语音动画技术提供了更广泛的访问途径。代码可在 https://serin-yoon.github.io/projects/anytalk/ 公开获取。
查看原文
查看缓存全文

缓存时间: 2026/08/18 07:52

论文页面 - AnyTalk:基于视频生成模型的任意角色语音动画

来源:https://huggingface.co/papers/2608.16143

摘要

AnyTalk通过角色特定微调和优化从合成说话头视频中提取的混合形状参数,能够利用视频扩散模型为任意角色生成无需动画数据的3D语音动画,并提供了用于实时应用的蒸馏版本。

我们提出了AnyTalk,一种无需任何动画数据即可为任意角色生成3D语音动画的新方法。现有的音频驱动3D语音动画方法依赖于特定角色的训练数据或繁琐的骨骼绑定/重新网格化流程,而AnyTalk通过利用在大规模视频数据集上训练的最新视频扩散模型(https://huggingface.co/papers?q=video%20diffusion%20models)来规避这些限制。我们首先通过角色特定微调(Character-specific Fine-tuning,简称CsF)(https://huggingface.co/papers?q=Character-specific%20Fine-tuning%20(CsF))技术,将预训练的视频扩散模型适配到目标角色。通过使用3D角色的渲染图像与表示“无动作”的零值音频嵌入进行微调,我们消除了对动画数据的需求,同时保留了大规模视频扩散模型的运动先验知识。然后,我们通过提出的优化流程(https://huggingface.co/papers?q=optimization%20process)估计混合形状参数(https://huggingface.co/papers?q=blendshape%20parameters),将生成的说话头视频提升为3D语音动画。AnyTalk使得不同面部网格和混合形状配置下的口型同步动画成为可能,显著减少了人工工作量和数据需求。我们进一步通过将AnyTalk蒸馏到一个精简的网络中——AnyTalk_RT——来增强其实用性,从而实现实时性能(https://huggingface.co/papers?q=real-time%20performance)。通过利用说话头视频生成(https://huggingface.co/papers?q=talking-head%20video%20generation),我们的方法扩大了音频驱动语音动画(https://huggingface.co/papers?q=audio-driven%20speech%20animation)技术对任意角色的可及性。代码在以下地址公开:https://serin-yoon.github.io/projects/anytalk/。

查看 arXiv 页面 (https://arxiv.org/abs/2608.16143) 查看 PDF (https://arxiv.org/pdf/2608.16143) 项目页面 (https://serin-yoon.github.io/projects/anytalk/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16143)

在您的代理中获取此论文:

hf papers read 2608.16143

没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash 进行安装。

引用此论文的模型

0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.16143 以从此页面关联。

引用此论文的数据集

0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.16143 以从此页面关联。

引用此论文的 Space

0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.16143 以从此页面关联。

包含此论文的收藏

0

暂无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面关联。

相似文章

Wan-Animate-2:拓展角色动画模型的应用边界

Reddit r/LocalLLaMA

Wan-Animate-2 是一个全新的端到端角色动画框架,它在重新设计的 Diffusion Transformer 中直接输入驱动视频,实现高保真动作生成和身份保持。它还推出了一个轻量级变体,用于实时流式动画,并已发布开源权重。

Avatar V:可规模化的视频参考虚拟化身视频生成

Hugging Face Daily Papers

Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。