Oxygen-TryOn:面向任意单品虚拟试穿的时尚原生基础模型

Hugging Face Daily Papers 论文

摘要

Oxygen-TryOn 是一个统一的面向任意单品虚拟试穿的基础模型,通过专用数据引擎和三阶段训练流程,在单件和多件试穿任务上实现了最先进的一致性及逼真度。

我们提出了 Oxygen-TryOn,一个统一的面向任意单品虚拟试穿的基础模型。Oxygen-TryOn 并非对通用图像编辑器的简单改造,而是为试穿而生的时尚原生模型,通过专用数据引擎和针对试穿设计的训练流程构建而成。给定一件或多件参考商品(干净的产品图或自然场景中穿着过的照片)以及一张目标主体图像,它能够合成主体穿着这些商品的照片级逼真图像,覆盖几乎任何时尚品类。以往的系统只能在室内环境下处理单一服装品类,而近期的多参考方法仍以服装为核心;相比之下,Oxygen-TryOn 支持多样的商品和场景,包括全身和半身视图、可变数量的参考图片以及自由的多件组合,同时忠实保持主体身份和商品外观。我们不再采用基于掩码的图像修复方法,而是将试穿重新定义为一项多参考、理解驱动的生成任务。我们构建了一个数据引擎,用于大规模收集、生成、标注和过滤高质量的试穿数据,并设计了三阶段训练管线:持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。强化学习阶段采用了混合奖励机制,结合了内部试穿奖励模型和专有的、基于评分标准的通用模型,共同监督细粒度一致性和指令级质量。它还能在同一轮次中遵循一般的编辑指令(例如姿势变换)。在公开基准测试和我们内部的 Oxygen-TryOn Bench 上,它在单件试穿上达到了最先进的一致性和逼真度,并在多件试穿上领先,匹配或超越了领先的专有系统(Nano Banana Pro、GPT-Image-2、Seedream5 Lite)和开源模型(FLUX.2)。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:33

Paper page - Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

来源:https://huggingface.co/papers/2607.21694 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

我们提出Oxygen-TryOn,这是一个用于任意物品虚拟试穿的统一基础模型。与改造通用图像编辑器不同,Oxygen-TryOn是原生面向时尚领域的,通过专用数据引擎和试穿特定训练构建而成。给定一个或多个参考物品(干净的商业拍摄图或非受控环境下的穿着照片)以及一张目标人物图像,它能合成一张逼真的人物图像,展示该人物穿着这些物品的场景,覆盖几乎任何时尚品类。以往的系統通常仅在影棚环境下处理单一服装类别,而近期的多参考方法仍以服装为中心;相比之下,Oxygen-TryOn支持多样化的物品和场景,包括全身和半身视图、可变数量的参考图以及自由的多物品组合,同时忠实保留人物身份和物品外观。我们不采用基于遮罩的修复方法,而是将试穿重新定义为一种多参考、理解驱动的生成任务。我们构建了一个数据引擎,用于大规模收集、生产、标注和过滤高质量的试穿数据,并设计了包含连续预训练(CPT)、监督微调(SFT)和强化学习(RL)的三阶段训练方案。RL阶段使用一种混合奖励,结合内部试穿奖励模型与一种专有的、基于评分准则的通用模型,共同监督细粒度一致性和指令级质量。同时,该模型在同一个前向过程中也能遵循通用编辑指令(如姿势变化)。在公开基准测试和我们的内部Oxygen-TryOnBench上,它在单物品试穿上达到了最先进的一致性和真实感,在多物品试穿上也处于领先地位,匹配或超越了领先的专有系统(NanoBananaPro、GPT-Image-2、Seedream5Lite)和开源模型(FLUX.2)。

查看arXiv页面 (https://arxiv.org/abs/2607.21694) 查看PDF (https://arxiv.org/pdf/2607.21694) 项目页面 (https://oxygenvision.github.io/Oxygen-TryOn/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21694)

在您的代理中获取此论文:

hf papers read 2607.21694

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.21694 以将其从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.21694 以将其从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.21694 以将其从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其从此页面链接。

相似文章

CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿

Hugging Face Daily Papers

本文介绍了VIP-SAM用于实例级服装分割,以及CtrlVTON,一个将试穿视为图像编辑问题的可控虚拟试穿框架,允许精确控制服装的布局、样式和位置。两种方法在各自任务上均达到最先进水平。

看向何处:基础模型能否通过主动探索达到目标视角?

Hugging Face Daily Papers

介绍了 Target Viewpoint Reproduction (TVR) 任务和 TVRBench 基准,用于评估基础模型主动调整 3D 视角以匹配目标图像的能力。实验揭示了当前开源和闭源模型的显著局限性,统一的后训练框架将成功率从约12%提升至约51%。

OpenMHC:加速可穿戴基础模型科学研究

arXiv cs.LG

OpenMHC推出了最大的开放获取可穿戴健康数据集,包含超过6000万小时的数据,并提供了可穿戴基础模型的开源实现,包括用于预测、插补和时序预测的统一基准测试。