TryOnCrafter: 通过可渲染的4D试穿代理释放相机轨迹实现逼真的视频虚拟试穿

Hugging Face Daily Papers 论文

摘要

本文提出了TryOnCrafter,一个用于相机可控视频虚拟试穿的新框架,利用可渲染的4D试穿代理和基于DiT的视频生成实现全方位视角探索,克服了现有方法依赖固定源相机轨迹的局限性。

尽管视频虚拟试穿(VVT)在动态主体上合成逼真的服装覆盖方面取得了显著进展,但现有范式仍然从根本上受限于对源相机轨迹的被动依赖,无法适应全方位视角探索所需的交互自由。为解决这一局限,我们定义了一个开创性的研究前沿:相机可控视频虚拟试穿(CaM-VVT)。与传统VVT不同,CaM-VVT不仅需要与视角无关的纹理幻觉,还要求在任意无约束的相机运动下,非刚性人体动态与背景场景之间的严格结构同步。为应对这些挑战,我们提出了TryOnCrafter,这是首个专门为CaM-VVT任务设计的统一基于DiT的框架。不同于隐式的像素空间操作,我们引入了一个可渲染的4D试穿代理,它将人体主体与环境明确解耦。这是通过将高保真2D试穿先验蒸馏到基于3DGS的穿衣化身中实现的,该化身随后通过SMPL-X序列进行动画化,并经过度量对齐融入重建的背景点云。该代理建立了稳健的结构基础,具有优越的纹理密度和运动完整性。我们的代理锚定视频DiT利用这一稳健的结构基础作为主要几何锚点,确保合成的逼真视频严格受预设轨迹和物理合理形变的约束。得益于4D代理固有的可编辑性,TryOnCrafter促进了多种下游应用,包括人体重定位、``子弹时间''效果和360度轨道观看。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:17

论文页面 - TryOnCrafter: 借助可渲染的4D试穿代理释放相机轨迹,实现逼真的视频虚拟试穿

来源:https://huggingface.co/papers/2606.26092 发布于 6月24日

·

由https://huggingface.co/QuanjianSong

lalala (https://huggingface.co/QuanjianSong)于6月25日提交

摘要

相机可控的视频虚拟试穿框架,利用带有显式人体-环境解耦的4D代理和基于DiT的视频生成,实现全向视角观看。

虽然视频虚拟试穿 (https://huggingface.co/papers?q=Video%20Virtual%20Try-on)(VVT)在动态对象上合成逼真衣物覆盖方面取得了显著进展,但现有范式仍从根本上受限于对源相机轨迹的被动依赖,无法满足全向视角探索所需的交互自由。为解决这一局限,我们定义了一个开创性的研究前沿:相机可控视频虚拟试穿 (https://huggingface.co/papers?q=Video%20Virtual%20Try-on)(CaM-VVT)。与传统VVT不同,CaM-VVT不仅需要与视角无关的纹理补全 (https://huggingface.co/papers?q=viewpoint-agnostic%20texture%20hallucination),还要求在任意无约束相机运动下,非刚性人体动态与背景上下文之间实现严格的结构同步 (https://huggingface.co/papers?q=structural%20synchronization)。为应对这些挑战,我们提出了TryOnCrafter,这是首个专为CaM-VVT任务设计的统一基于DiT的框架 (https://huggingface.co/papers?q=DiT-based%20framework)。与隐式的像素空间操作不同,我们引入了一个可渲染的4D试穿代理,将人体主体与环境显式解耦。这是通过将高保真2D试穿先验蒸馏到基于衣物3DGS的化身 (https://huggingface.co/papers?q=3DGS-based%20avatar)来实现的,随后通过SMPL-X序列 (https://huggingface.co/papers?q=SMPL-X%20sequences)驱动该化身,并按度量对齐到重建的背景点云 (https://huggingface.co/papers?q=background%20point%20cloud)中。该代理建立了具有优异纹理密度和运动完整性的稳健结构基础。我们的代理锚定视频DiT利用这一稳健的结构基础作为主要几何锚点 (https://huggingface.co/papers?q=geometric%20anchor),确保合成的逼真视频严格受预设轨迹和物理合理形变的约束。得益于4D代理 (https://huggingface.co/papers?q=4D%20proxy)固有的可编辑性,TryOnCrafter支持多种下游应用,包括人体重定位、“子弹时间”效果以及360度轨道观看。

查看 arXiv 页面 (https://arxiv.org/abs/2606.26092) 查看 PDF (https://arxiv.org/pdf/2606.26092) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.26092)

在你的代理中获取此论文:

hf papers read 2606.26092

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.26092,即可从此页面链接到它。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.26092,即可从此页面链接到它。

引用此论文的 Spaces 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2606.26092,即可从此页面链接到它。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,即可从此页面链接到它。

相似文章

CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿

Hugging Face Daily Papers

本文介绍了VIP-SAM用于实例级服装分割,以及CtrlVTON,一个将试穿视为图像编辑问题的可控虚拟试穿框架,允许精确控制服装的布局、样式和位置。两种方法在各自任务上均达到最先进水平。

4DAnyone:从普通单目视频创建4D人物

Hugging Face Daily Papers

4DAnyone通过生成多视角一致视频并将其提升到4D高斯溅射,从单目视频重建4D人物,并使用参考和目标上下文设计来解决扩展瓶颈。