Oxygen-TryOn:面向任意单品虚拟试穿的时尚原生基础模型
摘要
Oxygen-TryOn 是一个统一的面向任意单品虚拟试穿的基础模型,通过专用数据引擎和三阶段训练流程,在单件和多件试穿任务上实现了最先进的一致性及逼真度。
查看缓存全文
缓存时间: 2026/07/28 06:33
Paper page - Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
来源:https://huggingface.co/papers/2607.21694 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
我们提出Oxygen-TryOn,这是一个用于任意物品虚拟试穿的统一基础模型。与改造通用图像编辑器不同,Oxygen-TryOn是原生面向时尚领域的,通过专用数据引擎和试穿特定训练构建而成。给定一个或多个参考物品(干净的商业拍摄图或非受控环境下的穿着照片)以及一张目标人物图像,它能合成一张逼真的人物图像,展示该人物穿着这些物品的场景,覆盖几乎任何时尚品类。以往的系統通常仅在影棚环境下处理单一服装类别,而近期的多参考方法仍以服装为中心;相比之下,Oxygen-TryOn支持多样化的物品和场景,包括全身和半身视图、可变数量的参考图以及自由的多物品组合,同时忠实保留人物身份和物品外观。我们不采用基于遮罩的修复方法,而是将试穿重新定义为一种多参考、理解驱动的生成任务。我们构建了一个数据引擎,用于大规模收集、生产、标注和过滤高质量的试穿数据,并设计了包含连续预训练(CPT)、监督微调(SFT)和强化学习(RL)的三阶段训练方案。RL阶段使用一种混合奖励,结合内部试穿奖励模型与一种专有的、基于评分准则的通用模型,共同监督细粒度一致性和指令级质量。同时,该模型在同一个前向过程中也能遵循通用编辑指令(如姿势变化)。在公开基准测试和我们的内部Oxygen-TryOnBench上,它在单物品试穿上达到了最先进的一致性和真实感,在多物品试穿上也处于领先地位,匹配或超越了领先的专有系统(NanoBananaPro、GPT-Image-2、Seedream5Lite)和开源模型(FLUX.2)。
查看arXiv页面 (https://arxiv.org/abs/2607.21694) 查看PDF (https://arxiv.org/pdf/2607.21694) 项目页面 (https://oxygenvision.github.io/Oxygen-TryOn/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21694)
在您的代理中获取此论文:
hf papers read 2607.21694
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.21694 以将其从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.21694 以将其从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.21694 以将其从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其从此页面链接。
相似文章
Tstars-Tryon 1.0:面向多元时尚品类的鲁棒逼真虚拟试穿
Tstars-Tryon 1.0 是商业级虚拟试穿系统,可在多品类服饰中实现照片级真实、实时成衣可视化,已部署于淘宝,服务数百万用户。
TryOnCrafter: 通过可渲染的4D试穿代理释放相机轨迹实现逼真的视频虚拟试穿
本文提出了TryOnCrafter,一个用于相机可控视频虚拟试穿的新框架,利用可渲染的4D试穿代理和基于DiT的视频生成实现全方位视角探索,克服了现有方法依赖固定源相机轨迹的局限性。
CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿
本文介绍了VIP-SAM用于实例级服装分割,以及CtrlVTON,一个将试穿视为图像编辑问题的可控虚拟试穿框架,允许精确控制服装的布局、样式和位置。两种方法在各自任务上均达到最先进水平。
看向何处:基础模型能否通过主动探索达到目标视角?
介绍了 Target Viewpoint Reproduction (TVR) 任务和 TVRBench 基准,用于评估基础模型主动调整 3D 视角以匹配目标图像的能力。实验揭示了当前开源和闭源模型的显著局限性,统一的后训练框架将成功率从约12%提升至约51%。
OpenMHC:加速可穿戴基础模型科学研究
OpenMHC推出了最大的开放获取可穿戴健康数据集,包含超过6000万小时的数据,并提供了可穿戴基础模型的开源实现,包括用于预测、插补和时序预测的统一基准测试。