FaithfulFaces:用于文本到视频生成的姿态保真面部身份保留
摘要
FaithfulFaces 是一种新的文本到视频生成框架,通过姿态共享对齐和欧拉角嵌入,在姿态变化和遮挡情况下保持面部身份的一致性。
查看缓存全文
缓存时间: 2026/05/13 12:15
Paper page - FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation
Source: https://huggingface.co/papers/2605.04702
Abstract
FaithfulFaces 是一个面向姿态保真的人脸身份保持框架,它通过姿态共享对齐和显式欧拉角嵌入来改善文本到视频生成中的身份一致性。
Identity-preservingtext-to-video generation (https://huggingface.co/papers?q=text-to-video%20generation)(IPT2V) 使得用户能够生成具有多样性和想象力且保持人脸身份一致的视频。尽管最近取得了一些进展,现有方法通常在大的面部姿态变化或面部遮挡下会出现明显的身份失真。在本文中,我们提出了 FaithfulFaces,一个面向姿态保真的人脸身份保持 (https://huggingface.co/papers?q=pose-faithful%20facial%20identity%20preservation)学习框架,以改善复杂动态场景下的 IPT2V。FaithfulFaces 的核心是一个姿态共享的身份对齐器 (https://huggingface.co/papers?q=pose-shared%20identity%20aligner),它通过姿态共享字典 (https://huggingface.co/papers?q=pose-shared%20dictionary)和姿态变化身份不变性约束 (https://huggingface.co/papers?q=pose%20variation-identity%20invariance%20constraint) 来精细化和对齐不同视角的人脸姿态。通过将单视角输入映射为显式欧拉角嵌入的 (https://huggingface.co/papers?q=Euler%20angle%20embeddings)全局面部姿态表示 (https://huggingface.co/papers?q=global%20facial%20pose%20representation),FaithfulFaces 提供了一种姿态保真的面部先验,引导生成模型朝着健壮的身份保持生成方向前进。特别地,我们开发了一个专门的流程来策划一个高质量的视频数据集,该数据集包含大量的人脸姿态多样性。大量的实验表明,FaithfulFaces 达到了最先进的性能,即使在姿态变化和遮挡发生时也能保持优越的身份一致性 (https://huggingface.co/papers?q=identity%20consistency)和结构清晰度 (https://huggingface.co/papers?q=structural%20clarity)。
View arXiv page (https://arxiv.org/abs/2605.04702)View PDF (https://arxiv.org/pdf/2605.04702)Add to collection (https://huggingface.co/login?next=%2Fpapers%2F2605.04702)
将此论文添加到您的代理中:
hf papers read 2605\.04702
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
模型引用这篇论文0
没有模型链接这篇论文
在模型的 README.md 中引用 arxiv.org/abs/2605.04702 以从该页面链接它。
引用这篇论文的数据集0
没有数据集链接这篇论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.04702 以从该页面链接它。
引用这篇论文的项目0
没有项目链接这篇论文
在项目的 README.md 中引用 arxiv.org/abs/2605.04702 以从该页面链接它。
包含这篇论文的收藏集0
没有收藏集包含这篇论文
添加这篇论文到收藏集 (https://huggingface.co/new-collection)以从该页面链接它。
相似文章
FFAvatar: 少样本、前馈、可泛化的头像重建
FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。
Avatar V:可规模化的视频参考虚拟化身视频生成
Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。
@tom_doerr: 从音频生成高保真3D面部动画,具有准确的唇形同步和细腻的情感表达…
NVIDIA Audio2Face-3D 从音频生成高保真3D面部动画,提供准确的唇形同步和情感表达。它以开源SDK形式发布,包含预训练模型以及Maya和Unreal Engine 5的插件。
Faithful-MR1: 通过锚定与强化视觉注意实现可信的多模态推理
Faithful-MR1 是一个训练框架,通过 <Focus> 令牌锚定视觉注意,并利用反事实图像干预强化可信使用,从而提升多模态大语言模型(MLLM)中可信的多模态推理能力。它在使用更少训练数据的情况下,在 Qwen2.5-VL 骨干网络上的表现优于基线模型。
InsightTok:在离散标记化中提升文本与人脸保真度以改进自回归图像生成
InsightTok 引入内容感知的感知损失,改进离散视觉标记化以更好地重建文本和人脸,从而提升自回归图像生成质量。