ID-V2V:身份保留的视频重风格化
摘要
ID-V2V 是一个用于身份保留视频重风格化的视频到视频生成框架。它将身份保留视为视频重光照问题,并使用编辑后的关键帧进行风格传播,无需配对训练数据即可实现高质量结果。
查看缓存全文
缓存时间: 2026/07/28 06:34
论文页面 - ID-V2V: 保持身份的视频风格化转换
来源:https://huggingface.co/papers/2607.22830
摘要
在视觉叙事中,人物表演是创作意图和叙事意义的核心。然而,在保持人物身份和表演的同时实现灵活的视觉编辑,对生成式视频模型而言仍具挑战。我们将这一挑战形式化为“保持身份的视频风格化转换”,即根据已编辑的关键帧,在源视频中传播场景、光照和风格变化,同时保留面部相似性及表演细节(包括表情、视线方向和唇形同步)。主要障碍在于缺乏成对的训练数据,因为真实世界中保持身份的风格化视频对极为罕见。为解决这一问题,我们提出将基于源的身份保持与编辑驱动的视频合成进行解耦。我们的核心洞察是:面部外观和表情应保持不变,唯一允许的变化是光照。因此,我们将身份保持问题视为视频重光照问题,同时将视觉编辑的传播建模为由编辑关键帧引导的受控视频合成。基于这一思路,我们引入了ID-V2V——一个视频到视频的生成框架,它整合了互补的控制信号:重光照后的面部区域与面部法线图严格约束面部相似性和表演,而编辑关键帧和深度序列则实现灵活且时间一致性的生成。这一设计使得我们能够从单个视频构建训练对,从而无需稀缺的配对数据。大量实验表明,ID-V2V在保留面部相似性和细粒度面部表演方面显著优于现有方法,支持单主体和多主体场景,并输出高视觉质量,凸显了其作为面向真实世界内容生产的人本工具的潜力。代码地址:https://github.com/Eyeline-Labs/ID-V2V。
查看 arXiv 页面 (https://arxiv.org/abs/2607.22830)查看 PDF (https://arxiv.org/pdf/2607.22830)项目页面 (https://eyeline-labs.github.io/ID-V2V/)GitHub2 (https://github.com/Eyeline-Labs/ID-V2V)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22830)
在您的 agent 中获取此论文:
hf papers read 2607\.22830
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2607.22830,以从本页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.22830,以从本页面链接它。
引用此论文的Space0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.22830,以从本页面链接它。
包含此论文的合集0
没有合集包含此论文
将本文添加到一个合集 (https://huggingface.co/new-collection) 中,以从本页面链接它。
相似文章
SwiftI2V:一种通过条件分段生成实现高效高分辨率图像到视频生成的框架
SwiftI2V 是一个新颖的高效框架,用于高分辨率图像到视频的生成,它采用条件分段生成技术,在显著降低计算成本的同时实现了 2K 分辨率的合成。该框架使得在单个消费级或数据中心 GPU 上进行实用的生成成为可能,同时保持了输入的保真度。
Avatar V:可规模化的视频参考虚拟化身视频生成
Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。
ReImagine:以图像为先的可控高质量人体视频生成新思路
ReImagine 提出“图像优先”的可控高质量人体视频生成方案,借助 SMPL-X 动作引导与视频扩散模型,将外观建模与时间一致性解耦。
GraphVid:交互式图可控视频生成
GraphVid 提出了一种基于图条件的图像到视频生成模型,通过结构化交互图实现交互式控制,在 FID 和 FVD 上较先前方法有显著降低,表现优异。
VidSplat:利用几何引导的视频扩散先验进行高斯泼溅重建
VidSplat 是一种无需训练的生成式重建框架,它利用视频扩散先验,通过合成新视角,从稀疏输入中恢复完整的 3D 场景。