FaithfulFaces:用于文本到视频生成的姿态保真面部身份保留

Hugging Face Daily Papers 论文

摘要

FaithfulFaces 是一种新的文本到视频生成框架,通过姿态共享对齐和欧拉角嵌入,在姿态变化和遮挡情况下保持面部身份的一致性。

身份保留型文本到视频生成(IPT2V)使用户能够生成具有稳定人脸身份特征的多样化且富有想象力的视频。尽管近期取得了进展,但现有方法在面对较大的面部姿态变化或面部遮挡时,往往会出现显著的身份失真。在本文中,我们提出了 FaithfulFaces,这是一种姿态保真的面部身份保留学习框架,旨在改善复杂动态场景下的 IPT2V。FaithfulFaces 的核心是一个姿态共享的身份对齐器,它通过姿态共享字典和姿态变化-身份不变性约束,对不同视角下的面部姿态进行细化和对齐。通过将单视图输入映射为具有显式欧拉角嵌入的全局面部姿态表示,FaithfulFaces 提供了一种姿态保真的面部先验,引导生成模型进行鲁棒的身份保留生成。特别地,我们开发了一套专门的流程,以构建一个包含丰富面部姿态多样性的高质量视频数据集。大量的实验表明,FaithfulFaces 达到了最先进的性能,即使在姿态变化和遮挡发生时,也能保持卓越的身份一致性和结构清晰度。
查看原文
查看缓存全文

缓存时间: 2026/05/13 12:15

Paper page - FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation

Source: https://huggingface.co/papers/2605.04702

Abstract

FaithfulFaces 是一个面向姿态保真的人脸身份保持框架,它通过姿态共享对齐和显式欧拉角嵌入来改善文本到视频生成中的身份一致性。

Identity-preservingtext-to-video generation (https://huggingface.co/papers?q=text-to-video%20generation)(IPT2V) 使得用户能够生成具有多样性和想象力且保持人脸身份一致的视频。尽管最近取得了一些进展,现有方法通常在大的面部姿态变化或面部遮挡下会出现明显的身份失真。在本文中,我们提出了 FaithfulFaces,一个面向姿态保真的人脸身份保持 (https://huggingface.co/papers?q=pose-faithful%20facial%20identity%20preservation)学习框架,以改善复杂动态场景下的 IPT2V。FaithfulFaces 的核心是一个姿态共享的身份对齐器 (https://huggingface.co/papers?q=pose-shared%20identity%20aligner),它通过姿态共享字典 (https://huggingface.co/papers?q=pose-shared%20dictionary)和姿态变化身份不变性约束 (https://huggingface.co/papers?q=pose%20variation-identity%20invariance%20constraint) 来精细化和对齐不同视角的人脸姿态。通过将单视角输入映射为显式欧拉角嵌入的 (https://huggingface.co/papers?q=Euler%20angle%20embeddings)全局面部姿态表示 (https://huggingface.co/papers?q=global%20facial%20pose%20representation),FaithfulFaces 提供了一种姿态保真的面部先验,引导生成模型朝着健壮的身份保持生成方向前进。特别地,我们开发了一个专门的流程来策划一个高质量的视频数据集,该数据集包含大量的人脸姿态多样性。大量的实验表明,FaithfulFaces 达到了最先进的性能,即使在姿态变化和遮挡发生时也能保持优越的身份一致性 (https://huggingface.co/papers?q=identity%20consistency)和结构清晰度 (https://huggingface.co/papers?q=structural%20clarity)。

View arXiv page (https://arxiv.org/abs/2605.04702)View PDF (https://arxiv.org/pdf/2605.04702)Add to collection (https://huggingface.co/login?next=%2Fpapers%2F2605.04702)

将此论文添加到您的代理中:

hf papers read 2605\.04702

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

模型引用这篇论文0

没有模型链接这篇论文

在模型的 README.md 中引用 arxiv.org/abs/2605.04702 以从该页面链接它。

引用这篇论文的数据集0

没有数据集链接这篇论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.04702 以从该页面链接它。

引用这篇论文的项目0

没有项目链接这篇论文

在项目的 README.md 中引用 arxiv.org/abs/2605.04702 以从该页面链接它。

包含这篇论文的收藏集0

没有收藏集包含这篇论文

添加这篇论文到收藏集 (https://huggingface.co/new-collection)以从该页面链接它。

相似文章

FFAvatar: 少样本、前馈、可泛化的头像重建

Hugging Face Daily Papers

FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。

Avatar V:可规模化的视频参考虚拟化身视频生成

Hugging Face Daily Papers

Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。

Faithful-MR1: 通过锚定与强化视觉注意实现可信的多模态推理

arXiv cs.CL

Faithful-MR1 是一个训练框架,通过 <Focus> 令牌锚定视觉注意,并利用反事实图像干预强化可信使用,从而提升多模态大语言模型(MLLM)中可信的多模态推理能力。它在使用更少训练数据的情况下,在 Qwen2.5-VL 骨干网络上的表现优于基线模型。