CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿
摘要
本文介绍了VIP-SAM用于实例级服装分割,以及CtrlVTON,一个将试穿视为图像编辑问题的可控虚拟试穿框架,允许精确控制服装的布局、样式和位置。两种方法在各自任务上均达到最先进水平。
查看缓存全文
缓存时间: 2026/07/14 08:13
论文页面 - CtrlVTON: 基于视觉实例提示分割的可控虚拟试穿
来源: https://huggingface.co/papers/2607.09362
摘要
虚拟试穿(VTO)在将服装真实地迁移到目标人物身上方面取得了显著进展。然而,大多数系统给用户提供的对服装穿着方式的控制极少——包括其尺寸(宽松或合身)、款式(例如,塞进或不塞进、敞开或闭合)以及在身体上的空间位置。我们通过两项互补贡献来填补这一空白。首先,我们定义并通过VIP-SAM解决视觉实例提示分割(Visual-Instance-Prompt Segmentation):给定一件服装的平铺图像,在一个人穿着该服装的照片中分割出该特定实例。这是一个实例级别的任务,与通常研究的类别级别分割不同。其次,我们引入CtrlVTON,一个可控的VTO框架,它将试穿重新定义为图像编辑问题,并添加分割掩码作为对服装布局的像素级控制,包括款式、尺寸和在身体上的空间位置。VIP-SAM和CtrlVTON各自在其任务上达到了最先进的结果。特别是,CtrlVTON生成的图像比最强大的专有编辑系统更忠实地遵循用户提供的布局,同时在服装保真度上与它们匹敌。
查看arXiv页面 (https://arxiv.org/abs/2607.09362) 查看PDF (https://arxiv.org/pdf/2607.09362) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09362)
引用本文的模型 0
暂无模型链接本文
在模型的README.md中引用 arxiv.org/abs/2607.09362 即可从此页面链接。
引用本文的数据集 0
暂无数据集链接本文
在数据集的README.md中引用 arxiv.org/abs/2607.09362 即可从此页面链接。
引用本文的Spaces 0
暂无Space链接本文
在Space的README.md中引用 arxiv.org/abs/2607.09362 即可从此页面链接。
包含本文的收藏集 0
暂无收藏集包含本文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
Tstars-Tryon 1.0:面向多元时尚品类的鲁棒逼真虚拟试穿
Tstars-Tryon 1.0 是商业级虚拟试穿系统,可在多品类服饰中实现照片级真实、实时成衣可视化,已部署于淘宝,服务数百万用户。
TryOnCrafter: 通过可渲染的4D试穿代理释放相机轨迹实现逼真的视频虚拟试穿
本文提出了TryOnCrafter,一个用于相机可控视频虚拟试穿的新框架,利用可渲染的4D试穿代理和基于DiT的视频生成实现全方位视角探索,克服了现有方法依赖固定源相机轨迹的局限性。
Oxygen-TryOn:面向任意单品虚拟试穿的时尚原生基础模型
Oxygen-TryOn 是一个统一的面向任意单品虚拟试穿的基础模型,通过专用数据引擎和三阶段训练流程,在单件和多件试穿任务上实现了最先进的一致性及逼真度。
FashionChameleon: 迈向实时交互式人体-服装视频定制
FashionChameleon 是一个实时交互式框架,用于人体-服装视频定制,采用教师-学生蒸馏和上下文学习技术,实现多服装切换并保持运动连贯性,在单个GPU上达到23.8 FPS。
文本-视觉协同指导的图像编辑
一种名为TV-Edit的新框架,结合文本指令和视觉提示实现精确图像编辑,并附带基准TV-Edit-Bench用于评估。该方法在空间控制和语义忠实度上优于现有方法。