Avatar V:可规模化的视频参考虚拟化身视频生成

Hugging Face Daily Papers 论文

摘要

Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。

生成不仅在外观上类似于目标个体、而且在行为上可识别、忠实地再现其说话节奏、手势习惯和表情动态的虚拟化身视频,仍然是一个开放挑战。现有方法主要依赖于单一静态图像,这提供的身份信息不足,无法捕捉动态运动特征,而标准的像素级目标函数对决定化身保真度的感知关键面部区域关注不足。我们提出 Avatar V,一个通过视频参考条件身份建模来解决这些限制的生产级框架。该模型不将身份压缩成固定大小的嵌入,而是直接基于参考视频的完整令牌序列进行条件处理,通过关注参考上下文来学习再现静态身份属性(面部几何、皮肤纹理)和动态行为模式(说话节奏、微表情)。我们引入了稀疏参考注意力(Sparse Reference Attention),一种非对称机制,能够以线性复杂度条件处理任意长度的参考;一个运动表示流,实现闭环说话风格迁移;以及一个身份感知超分辨率精炼器,继承完整的参考条件。这些由数据引擎支持,该引擎从5000万原始视频中精选出1亿+训练片段,以及一个五阶段训练流程,包括流匹配预训练、个性微调、两阶段蒸馏(>10倍加速)和RLHF对齐,部署在数千GPU上。Avatar V 生成无限时长1080p视频,在我们的跨场景基准测试中实现了最先进的身份保持、唇形同步和生成质量,在自动度量指标和人工评估中均持续优于包括 Seedance 2.0、Kling O3 Pro、Veo 3.1 和 OmniHuman 1.5 在内的领先系统。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:04

论文页面 - Avatar V:扩展视频参考的虚拟人视频生成

来源:https://huggingface.co/papers/2606.13872 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Avatar V 是一个生产级框架,通过稀疏注意力机制和运动表示流,以完整视频参考为条件,生成行为上可识别的虚拟人视频。

生成不仅在外观上与目标个体视觉相似,而且行为上可识别、忠实再现其说话节奏、手势习惯和表情动态的虚拟人视频,仍然是一个开放挑战。现有方法主要依赖于单张静态图像,这提供的身份信息不足,且无法捕捉动态运动特征;而标准的像素级目标函数对决定虚拟人保真度的感知关键面部区域关注不够。我们提出 Avatar V,一个生产级框架,通过视频参考条件身份建模(https://huggingface.co/papers?q=video-reference-conditioned%20identity%20modeling)来解决这些限制。该模型不将身份压缩为固定大小的嵌入,而是直接以参考视频的完整 token 序列为条件,通过对参考上下文的注意力学习,重现静态身份属性(面部几何、皮肤纹理)和动态行为模式(说话节奏、微表情)。我们引入了稀疏参考注意力(https://huggingface.co/papers?q=Sparse%20Reference%20Attention),一种非对称机制,实现对任意长参考的线性复杂度条件化;运动表示流(https://huggingface.co/papers?q=motion%20representation%20stream),支持闭环说话风格迁移;以及身份感知超分辨率精炼器(https://huggingface.co/papers?q=identity-aware%20super-resolution%20refiner),继承完整的参考条件化。这些技术由一个数据引擎支持,该引擎从 5000 万原始视频中筛选出 1 亿以上的训练片段,并采用五阶段训练流程,包括流匹配预训练(https://huggingface.co/papers?q=flow%20matching%20pre-training)、个性微调(https://huggingface.co/papers?q=personality%20fine-tuning)、两阶段蒸馏(https://huggingface.co/papers?q=two-phase%20distillation)(>10 倍加速)和RLHF 对齐(https://huggingface.co/papers?q=RLHF%20alignment),部署在数千个 GPU 上。Avatar V 可生成无限时长的 1080p 视频,在跨场景基准(https://huggingface.co/papers?q=cross-scene%20benchmark)上实现了身份保持、唇形同步和生成质量的最先进水平,在自动指标和人工评估中均持续优于 Seedance 2.0、Kling O3 Pro、Veo 3.1 和 OmniHuman 1.5 等领先系统。

查看 arXiv 页面(https://arxiv.org/abs/2606.13872)查看 PDF(https://arxiv.org/pdf/2606.13872)项目页面(https://www.heygen.com/research/avatar-v-model)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.13872)

在您的 agent 中获取这篇论文:

hf papers read 2606.13872

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接这篇论文

在模型 README.md 中引用 arxiv.org/abs/2606.13872 即可从此页面链接。

引用此论文的数据集0

没有数据集链接这篇论文

在数据集 README.md 中引用 arxiv.org/abs/2606.13872 即可从此页面链接。

引用此论文的 Spaces0

没有 Space 链接这篇论文

在 Space README.md 中引用 arxiv.org/abs/2606.13872 即可从此页面链接。

包含此论文的收藏0

没有收藏包含这篇论文

将这篇论文添加到收藏(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

FFAvatar: 少样本、前馈、可泛化的头像重建

Hugging Face Daily Papers

FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。