Avatar V:可规模化的视频参考虚拟化身视频生成
摘要
Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。
查看缓存全文
缓存时间: 2026/06/15 09:04
论文页面 - Avatar V:扩展视频参考的虚拟人视频生成
来源:https://huggingface.co/papers/2606.13872 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Avatar V 是一个生产级框架,通过稀疏注意力机制和运动表示流,以完整视频参考为条件,生成行为上可识别的虚拟人视频。
生成不仅在外观上与目标个体视觉相似,而且行为上可识别、忠实再现其说话节奏、手势习惯和表情动态的虚拟人视频,仍然是一个开放挑战。现有方法主要依赖于单张静态图像,这提供的身份信息不足,且无法捕捉动态运动特征;而标准的像素级目标函数对决定虚拟人保真度的感知关键面部区域关注不够。我们提出 Avatar V,一个生产级框架,通过视频参考条件身份建模(https://huggingface.co/papers?q=video-reference-conditioned%20identity%20modeling)来解决这些限制。该模型不将身份压缩为固定大小的嵌入,而是直接以参考视频的完整 token 序列为条件,通过对参考上下文的注意力学习,重现静态身份属性(面部几何、皮肤纹理)和动态行为模式(说话节奏、微表情)。我们引入了稀疏参考注意力(https://huggingface.co/papers?q=Sparse%20Reference%20Attention),一种非对称机制,实现对任意长参考的线性复杂度条件化;运动表示流(https://huggingface.co/papers?q=motion%20representation%20stream),支持闭环说话风格迁移;以及身份感知超分辨率精炼器(https://huggingface.co/papers?q=identity-aware%20super-resolution%20refiner),继承完整的参考条件化。这些技术由一个数据引擎支持,该引擎从 5000 万原始视频中筛选出 1 亿以上的训练片段,并采用五阶段训练流程,包括流匹配预训练(https://huggingface.co/papers?q=flow%20matching%20pre-training)、个性微调(https://huggingface.co/papers?q=personality%20fine-tuning)、两阶段蒸馏(https://huggingface.co/papers?q=two-phase%20distillation)(>10 倍加速)和RLHF 对齐(https://huggingface.co/papers?q=RLHF%20alignment),部署在数千个 GPU 上。Avatar V 可生成无限时长的 1080p 视频,在跨场景基准(https://huggingface.co/papers?q=cross-scene%20benchmark)上实现了身份保持、唇形同步和生成质量的最先进水平,在自动指标和人工评估中均持续优于 Seedance 2.0、Kling O3 Pro、Veo 3.1 和 OmniHuman 1.5 等领先系统。
查看 arXiv 页面(https://arxiv.org/abs/2606.13872)查看 PDF(https://arxiv.org/pdf/2606.13872)项目页面(https://www.heygen.com/research/avatar-v-model)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.13872)
在您的 agent 中获取这篇论文:
hf papers read 2606.13872
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接这篇论文
在模型 README.md 中引用 arxiv.org/abs/2606.13872 即可从此页面链接。
引用此论文的数据集0
没有数据集链接这篇论文
在数据集 README.md 中引用 arxiv.org/abs/2606.13872 即可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接这篇论文
在 Space README.md 中引用 arxiv.org/abs/2606.13872 即可从此页面链接。
包含此论文的收藏0
没有收藏包含这篇论文
将这篇论文添加到收藏(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
SpatialAvatar-0:基于多阶段重建的高质量4D头部虚拟形象
SpatialAvatar-0 提出了一种基于共享 FLAME 网格绑定高斯表示的多阶段重建方法,用于高质量4D头部虚拟形象,在多个基准测试中实现了更优性能,且迭代次数更少。
FFAvatar: 少样本、前馈、可泛化的头像重建
FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。
Vidu S2: 实时交互、可编辑和空间视频生成
Vidu S2 推出了用于头像和视频编辑的实时交互式 AI 模型,支持动态参考更新的高分辨率空间视频生成,并在基准测试中表现出色。
更便宜、更快且具有文化感知力,Avataar的视频AI专为印度的大规模应用而构建
Avataar AI推出Varya,这是一款针对印度规模和背景优化的视频生成模型,利用从Wan 2.2蒸馏的技术,实现了20倍成本降低和对本地细微差别的理解。
EvolvingAvatar: 随对话展开而自适应的交互式3D头部生成
EvolvingAvatar 引入了一个因果性3D头部生成系统,该系统使用测试时训练实时适应对话上下文,在对话场景中增强运动统计。