TryOnCrafter: 通过可渲染的4D试穿代理释放相机轨迹实现逼真的视频虚拟试穿
摘要
本文提出了TryOnCrafter,一个用于相机可控视频虚拟试穿的新框架,利用可渲染的4D试穿代理和基于DiT的视频生成实现全方位视角探索,克服了现有方法依赖固定源相机轨迹的局限性。
查看缓存全文
缓存时间: 2026/06/25 05:17
论文页面 - TryOnCrafter: 借助可渲染的4D试穿代理释放相机轨迹,实现逼真的视频虚拟试穿
来源:https://huggingface.co/papers/2606.26092 发布于 6月24日
·
由https://huggingface.co/QuanjianSong
lalala (https://huggingface.co/QuanjianSong)于6月25日提交
摘要
相机可控的视频虚拟试穿框架,利用带有显式人体-环境解耦的4D代理和基于DiT的视频生成,实现全向视角观看。
虽然视频虚拟试穿 (https://huggingface.co/papers?q=Video%20Virtual%20Try-on)(VVT)在动态对象上合成逼真衣物覆盖方面取得了显著进展,但现有范式仍从根本上受限于对源相机轨迹的被动依赖,无法满足全向视角探索所需的交互自由。为解决这一局限,我们定义了一个开创性的研究前沿:相机可控视频虚拟试穿 (https://huggingface.co/papers?q=Video%20Virtual%20Try-on)(CaM-VVT)。与传统VVT不同,CaM-VVT不仅需要与视角无关的纹理补全 (https://huggingface.co/papers?q=viewpoint-agnostic%20texture%20hallucination),还要求在任意无约束相机运动下,非刚性人体动态与背景上下文之间实现严格的结构同步 (https://huggingface.co/papers?q=structural%20synchronization)。为应对这些挑战,我们提出了TryOnCrafter,这是首个专为CaM-VVT任务设计的统一基于DiT的框架 (https://huggingface.co/papers?q=DiT-based%20framework)。与隐式的像素空间操作不同,我们引入了一个可渲染的4D试穿代理,将人体主体与环境显式解耦。这是通过将高保真2D试穿先验蒸馏到基于衣物3DGS的化身 (https://huggingface.co/papers?q=3DGS-based%20avatar)来实现的,随后通过SMPL-X序列 (https://huggingface.co/papers?q=SMPL-X%20sequences)驱动该化身,并按度量对齐到重建的背景点云 (https://huggingface.co/papers?q=background%20point%20cloud)中。该代理建立了具有优异纹理密度和运动完整性的稳健结构基础。我们的代理锚定视频DiT利用这一稳健的结构基础作为主要几何锚点 (https://huggingface.co/papers?q=geometric%20anchor),确保合成的逼真视频严格受预设轨迹和物理合理形变的约束。得益于4D代理 (https://huggingface.co/papers?q=4D%20proxy)固有的可编辑性,TryOnCrafter支持多种下游应用,包括人体重定位、“子弹时间”效果以及360度轨道观看。
查看 arXiv 页面 (https://arxiv.org/abs/2606.26092) 查看 PDF (https://arxiv.org/pdf/2606.26092) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.26092)
在你的代理中获取此论文:
hf papers read 2606.26092
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.26092,即可从此页面链接到它。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.26092,即可从此页面链接到它。
引用此论文的 Spaces 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.26092,即可从此页面链接到它。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,即可从此页面链接到它。
相似文章
Track2View:通过配对3D点轨迹实现4D一致的相机控制视频生成
Track2View 通过将视频扩散转换器基于配对3D点轨迹进行条件生成,从视频中生成新的相机视角,实现了最先进的视觉质量,并显著降低了旋转和平移误差。
Pantheon360: 通过3D感知360度视频扩散驯服数字孪生生成
Pantheon360引入了一种3D感知360度视频扩散框架,该框架使用显式3D缓存来强制执行几何一致性,从而能够从稀疏360度输入中生成高保真数字孪生。
CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿
本文介绍了VIP-SAM用于实例级服装分割,以及CtrlVTON,一个将试穿视为图像编辑问题的可控虚拟试穿框架,允许精确控制服装的布局、样式和位置。两种方法在各自任务上均达到最先进水平。
Oxygen-TryOn:面向任意单品虚拟试穿的时尚原生基础模型
Oxygen-TryOn 是一个统一的面向任意单品虚拟试穿的基础模型,通过专用数据引擎和三阶段训练流程,在单件和多件试穿任务上实现了最先进的一致性及逼真度。
4DAnyone:从普通单目视频创建4D人物
4DAnyone通过生成多视角一致视频并将其提升到4D高斯溅射,从单目视频重建4D人物,并使用参考和目标上下文设计来解决扩展瓶颈。