ID-V2V:身份保留的视频重风格化

Hugging Face Daily Papers 论文

摘要

ID-V2V 是一个用于身份保留视频重风格化的视频到视频生成框架。它将身份保留视为视频重光照问题,并使用编辑后的关键帧进行风格传播,无需配对训练数据即可实现高质量结果。

在视觉叙事中,人类表演是创作意图和叙事意义的中心。然而,在实现灵活视觉编辑的同时保持人类身份和表演,对于生成式视频模型而言仍然具有挑战性。我们将这一挑战形式化为身份保留的视频重风格化,即根据编辑后的关键帧所指定的场景、光照和风格变化,在源视频中进行传播,同时保持面部相似性和表演(包括表情、视线方向和唇形同步)。一个关键障碍是缺乏配对训练数据,因为在现实场景中,身份保留的重风格化视频对非常罕见。为了解决这一问题,我们提出将基于源的身份保留与编辑驱动的视频合成进行解耦。我们的关键洞察是,面部外观和表情应保持不变,光照是唯一允许的主要变化。因此,我们将身份保留视为一个视频重光照问题,同时将视觉编辑传播建模为由编辑关键帧引导的受控视频合成。基于这一思路,我们引入了 ID-V2V,这是一个视频到视频生成框架,整合了互补的控制信号:重光照的面部区域和面部法线图严格约束面部相似性和表演,而编辑后的关键帧和深度序列则实现灵活且时间连贯的生成。这种设计使得从单个视频构建训练对成为可能,从而消除了对稀缺配对数据的需求。大量实验表明,ID-V2V 在保留面部相似性和细粒度面部表演方面显著优于现有方法,支持单主体和多主体场景,并呈现出高视觉质量,凸显了其作为以人为中心的工具在现实世界内容生产中的潜力。代码地址:https://github.com/Eyeline-Labs/ID-V2V。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:34

论文页面 - ID-V2V: 保持身份的视频风格化转换

来源:https://huggingface.co/papers/2607.22830

摘要

在视觉叙事中,人物表演是创作意图和叙事意义的核心。然而,在保持人物身份和表演的同时实现灵活的视觉编辑,对生成式视频模型而言仍具挑战。我们将这一挑战形式化为“保持身份的视频风格化转换”,即根据已编辑的关键帧,在源视频中传播场景、光照和风格变化,同时保留面部相似性及表演细节(包括表情、视线方向和唇形同步)。主要障碍在于缺乏成对的训练数据,因为真实世界中保持身份的风格化视频对极为罕见。为解决这一问题,我们提出将基于源的身份保持与编辑驱动的视频合成进行解耦。我们的核心洞察是:面部外观和表情应保持不变,唯一允许的变化是光照。因此,我们将身份保持问题视为视频重光照问题,同时将视觉编辑的传播建模为由编辑关键帧引导的受控视频合成。基于这一思路,我们引入了ID-V2V——一个视频到视频的生成框架,它整合了互补的控制信号:重光照后的面部区域与面部法线图严格约束面部相似性和表演,而编辑关键帧和深度序列则实现灵活且时间一致性的生成。这一设计使得我们能够从单个视频构建训练对,从而无需稀缺的配对数据。大量实验表明,ID-V2V在保留面部相似性和细粒度面部表演方面显著优于现有方法,支持单主体和多主体场景,并输出高视觉质量,凸显了其作为面向真实世界内容生产的人本工具的潜力。代码地址:https://github.com/Eyeline-Labs/ID-V2V。

查看 arXiv 页面 (https://arxiv.org/abs/2607.22830)查看 PDF (https://arxiv.org/pdf/2607.22830)项目页面 (https://eyeline-labs.github.io/ID-V2V/)GitHub2 (https://github.com/Eyeline-Labs/ID-V2V)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22830)

在您的 agent 中获取此论文:

hf papers read 2607\.22830

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2607.22830,以从本页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2607.22830,以从本页面链接它。

引用此论文的Space0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.22830,以从本页面链接它。

包含此论文的合集0

没有合集包含此论文

将本文添加到一个合集 (https://huggingface.co/new-collection) 中,以从本页面链接它。

相似文章

Avatar V:可规模化的视频参考虚拟化身视频生成

Hugging Face Daily Papers

Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。

GraphVid:交互式图可控视频生成

Hugging Face Daily Papers

GraphVid 提出了一种基于图条件的图像到视频生成模型,通过结构化交互图实现交互式控制,在 FID 和 FVD 上较先前方法有显著降低,表现优异。