CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿

Hugging Face Daily Papers 论文

摘要

本文介绍了VIP-SAM用于实例级服装分割,以及CtrlVTON,一个将试穿视为图像编辑问题的可控虚拟试穿框架,允许精确控制服装的布局、样式和位置。两种方法在各自任务上均达到最先进水平。

虚拟试穿(VTO)在将服装逼真地迁移到目标人物身上取得了显著进展。然而,大多数系统给予用户对服装穿着方式的控制很少——其尺寸(宽松或贴身)、风格(例如,塞入或垂下、敞开或闭合)以及身体上的空间位置。我们通过两个互补性贡献填补了这一空白。首先,我们定义并通过VIP-SAM解决了视觉实例提示分割:给定一张服装的平铺图,在穿着该服装的人的照片中分割出该特定实例。这是一个实例级任务,与通常研究的类别级分割不同。其次,我们引入了CtrlVTON,一个可控的VTO框架,将试穿重新定义为图像编辑问题,并添加分割掩码作为对服装布局(包括风格、尺寸和身体上的空间位置)的像素级控制。VIP-SAM和CtrlVTON各自在各自任务上达到了最先进的结果。特别是,CtrlVTON生成的图像遵循用户提供的布局,比最强的专有编辑系统更加忠实,同时在服装保真度上与之匹敌。
查看原文
查看缓存全文

缓存时间: 2026/07/14 08:13

论文页面 - CtrlVTON: 基于视觉实例提示分割的可控虚拟试穿

来源: https://huggingface.co/papers/2607.09362

摘要

虚拟试穿(VTO)在将服装真实地迁移到目标人物身上方面取得了显著进展。然而,大多数系统给用户提供的对服装穿着方式的控制极少——包括其尺寸(宽松或合身)、款式(例如,塞进或不塞进、敞开或闭合)以及在身体上的空间位置。我们通过两项互补贡献来填补这一空白。首先,我们定义并通过VIP-SAM解决视觉实例提示分割(Visual-Instance-Prompt Segmentation):给定一件服装的平铺图像,在一个人穿着该服装的照片中分割出该特定实例。这是一个实例级别的任务,与通常研究的类别级别分割不同。其次,我们引入CtrlVTON,一个可控的VTO框架,它将试穿重新定义为图像编辑问题,并添加分割掩码作为对服装布局的像素级控制,包括款式、尺寸和在身体上的空间位置。VIP-SAM和CtrlVTON各自在其任务上达到了最先进的结果。特别是,CtrlVTON生成的图像比最强大的专有编辑系统更忠实地遵循用户提供的布局,同时在服装保真度上与它们匹敌。

查看arXiv页面 (https://arxiv.org/abs/2607.09362) 查看PDF (https://arxiv.org/pdf/2607.09362) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09362)

引用本文的模型 0

暂无模型链接本文

在模型的README.md中引用 arxiv.org/abs/2607.09362 即可从此页面链接。

引用本文的数据集 0

暂无数据集链接本文

在数据集的README.md中引用 arxiv.org/abs/2607.09362 即可从此页面链接。

引用本文的Spaces 0

暂无Space链接本文

在Space的README.md中引用 arxiv.org/abs/2607.09362 即可从此页面链接。

包含本文的收藏集 0

暂无收藏集包含本文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

文本-视觉协同指导的图像编辑

Hugging Face Daily Papers

一种名为TV-Edit的新框架,结合文本指令和视觉提示实现精确图像编辑,并附带基准TV-Edit-Bench用于评估。该方法在空间控制和语义忠实度上优于现有方法。