基于Unified Sequential Composition Models的时尚服装生成
摘要
本文提出了Unified Sequential Composition Model(USCM)和Latent Expansion Monte Carlo Tree Search(LE-MCTS),用于时尚服装生成,在多个数据集上实现了最先进的性能。
arXiv:2608.13888v1 Announce Type: new
摘要:从大规模物品库中合成风格一致的时尚服装的任务,即时尚服装生成,仍然是一个非平凡的挑战,主要由于审美兼容性的非单调和隐式性质,以及组合搜索空间的指数级增长。在本文中,我们将此任务形式化为约束集成生成(CEG),并将其建模为有限视野确定性马尔可夫决策过程。为了解决时尚中的CEG问题,我们提出了Unified Sequential Composition Model(USCM),它联合建模集合级兼容性和潜在组合意图。在USCM学习先验的指导下,我们提出了Latent Expansion Monte Carlo Tree Search(LE-MCTS)机制来处理组合过程中的物品检索,平衡局部审美协同和全局结构平衡。在Polyvore Outfits数据集上的广泛实验,以及在iFashion和PolyvoreU数据集上的零样本评估表明,我们的框架在独立人类偏好评估、自动化审美代理和约束时尚服装生成的结构有效性指标方面,实现了最先进的性能。
查看缓存全文
缓存时间: 2026/08/17 10:15
# 通过统一序列组合模型实现时尚套装生成 来源:https://arxiv.org/html/2608.13888 **作者** **康凯诚** 单位:设计人工智能实验室 单位:中国香港 邮箱:[[email protected]](mailto:) **邹星星** 单位:香港理工大学 单位:中国香港 邮箱:[[email protected]](mailto:) **徐若涵** 单位:昆士兰大学 单位:澳大利亚布里斯班 邮箱:[[email protected]](mailto:) **黄伟强**(通讯作者) 单位:设计人工智能实验室 单位:中国香港 邮箱:[[email protected]](mailto:) ###### 摘要 从海量单品库中合成风格连贯的时尚套装(即时尚套装生成)仍是一项极具挑战性的任务,主要归因于审美兼容性的非单调性与隐含性,以及组合搜索空间呈指数级增长。本文将该任务形式化为**约束集成生成**,并将其建模为有限时域确定性马尔可夫决策过程。为解决时尚领域的约束集成生成问题,我们提出**统一序列组合模型**,该模型联合建模集合级兼容性与潜在组合意图。在统一序列组合模型学习到的先验知识引导下,我们进一步提出**潜在扩展蒙特卡洛树搜索**机制,用于处理组合过程中的单品检索,平衡局部审美协同与全局结构平衡。在Polyvore Outfits数据集上的大量实验以及在iFashion和PolyvoreU数据集上的零样本评估表明,本框架在独立人类偏好评估、自动化审美代理指标以及约束时尚套装生成的结构有效性指标上均达到了最优性能。 ## 1 引言 时尚套装生成——将服装与配饰组合成风格连贯整体的艺术——在现代零售生态系统中扮演着日益重要的角色。然而,实际生成高质量套装仍面临挑战,因为确保风格一致性需要在大规模数据库中筛选,导致可能的解决方案呈组合爆炸式增长。本文将合成协调单品集合(如策划播放列表或设计家具布局)的普遍挑战形式化为**约束集成生成**。具体而言,约束集成生成定义的任务是:从海量数据库中选择单品扩展种子集成,生成同时满足结构要求与潜在风格规律的完整集成。我们聚焦时尚套装生成作为其典型实例,如图1(https://arxiv.org/html/2608.13888#S1.F1)所示。 本质上,约束集成生成是一个搜索空间呈指数级增长的序列组合优化问题。为有效解决该问题,我们将生成过程建模为有限时域、确定性的**马尔可夫决策过程**,其中状态定义为种子集成与当前步骤所有已选单品的并集。通过将状态表示为集合而非序列,该建模方式确保过程具有马尔可夫性,同时固有地保持置换不变性。每个动作对应于从数据库中选择新单品加入演化中的集成。目标是探索这一庞大搜索空间,找到能最大化全局约束感知兼容函数的终端状态。 然而,解决该特定马尔可夫决策过程面临三大挑战:(1)**组合爆炸**。现实世界的时尚数据库作为大规模离散存储库,导致可能的集成组合呈爆炸式增长,穷举搜索或标准组合优化方法在计算上不可行。(2)**非单调潜在目标**。时尚兼容性函数缺乏闭式表达,必须从数据中学习。其本质是非单调的——添加单个单品可能在局部改善集成,却可能破坏全局协调性。(3)**稀疏延迟奖励信号**。在主流时尚数据集中,人工策划的集成仅占庞大组合空间的极小部分。由于真值标签仅存在于这些罕见的完整套装中,部分状态在集成构建过程中缺乏直接监督来评估其审美兼容性。 > **图1**:时尚领域约束集成生成示意图。给定种子集成S₀和大规模数据库𝒳,目标是合成一个最大化约束感知兼容性目标的协调套装。传统的**判别式评分方法**(红色路径)缺乏预测下一单品意图的策略引导,迫使对候选库进行暴力检索,常导致结构或风格失败。相比之下,我们提出的**统一序列组合模型**(绿色路径)利用学习到的策略先验与价值代理生成协调套装。 先前神经时尚推荐研究大多回避了这些核心挑战。早期研究主要关注评估预组成套装的审美兼容性(10、21、18、8),支持在静态候选集中选择而非生成新组合。较新方法(14、20、1)转向互补单品推荐,目标是识别单个单品来完成几乎成型的套装。虽然这些范式提供了有用基础,但在实际套装生成中仍存在局限:前者本质上是事后过滤,后者将套装生成简化为贪婪完成过程。两者都未预见在稀疏奖励环境中序列动作的长期审美后果。 为弥合这一差距,我们引入基于**统一序列组合模型**的表示驱动集成合成框架。具体而言,统一序列组合模型联合学习兼容性评估与策略先验,并与**潜在扩展蒙特卡洛树搜索**结合,通过动态潜在分支扩展为约束集成生成问题执行前瞻性候选选择。作为框架的核心表示引擎,统一序列组合模型通过双路径Transformer架构将当前集成状态转换为可操作的搜索指导。具体来说,**价值头**估计集成的兼容性分数(v̂ₜ)以提供密集审美反馈,而**策略头**将查询集成投射到连续潜在意图(zₜ)中,以指导在潜在流形内的候选发现。此外,统一序列组合模型能够将数据库单品嵌入共享流形以实现高效检索。不同于依赖独立模型实现这些功能的先前流程(20),统一序列组合模型采用多任务学习范式。这种联合优化利用任务协同性捕捉深层风格关联,同时减少参数冗余。 为在生成阶段补充统一序列组合模型,我们引入**潜在扩展蒙特卡洛树搜索**来处理海量数据库上的集合合成。潜在扩展蒙特卡洛树搜索不枚举离散数据库单品,而是利用统一序列组合模型的策略意图zₜ进行Top-k潜在检索,并利用其价值分数v̂ₜ进行分支评估。给定模拟预算M,潜在扩展蒙特卡洛树搜索评估潜在单品组合以避免短视选择,确保合成的集成同时满足审美与结构约束。 在三个主流数据集(Polyvore Outfits、iFashion和PolyvoreU)上的大量实验实证验证了我们的方法。关键是,统一序列组合模型在基本判别任务上建立了新最优结果,展示了其作为核心启发式引擎的卓越表示能力。在时尚生成任务上,我们的框架始终明显超越贪婪基线和基于检索的方法。此外,结构指标评估确认我们的方法在不依赖显式结构规则的情况下最佳满足结构规则。全面的消融研究突出了统一架构、搜索策略与预算的优势,以及框架对未见数据的鲁棒零样本迁移能力。 我们的主要贡献总结如下: - 我们将**约束集成生成**形式化为确定性马尔可夫决策过程,提供统一的问题表述来解决集合合成中的组合爆炸、非单调目标与稀疏反馈问题,以时尚套装生成为实例。 - 我们提出**统一序列组合模型**,一个统一的多任务表示网络,将套装兼容性评估与下一单品潜在意图预测集成在单品与集成的共享多模态流形中。在生成阶段,它与潜在扩展蒙特卡洛树搜索机制结合进行前瞻性候选选择。 - 大量评估表明,本框架在基本判别基准和约束集成生成任务上均达到最优性能,验证了其即使在零样本场景中也能导航复杂审美景观的能力。 ## 2 相关工作 早期研究时尚套装生成的工作集中于判别任务,使用度量学习(10)、子空间投影(22)和图神经网络(9)预测套装兼容性。该领域进一步发展到整合大型多模态模型(5)和图注意力网络(19)。然而,这些方法仍是被动评估器,无法导航高成本搜索空间进行集成组合。 近期,生成式方法(21、20)出现以解决互补单品检索任务,通常通过预测潜在嵌入从数据库中检索单品。一些方法也利用图神经网络进行选择逻辑(3),以及图像到图像转换生成检索模板(1)。然而,这些方法主要为单步推荐设计,缺乏对每个选择的预见性。因此,它们对贪婪决策的依赖常导致生成序列单品时风格不一致。 另一支生成式研究(25、23、24)专注于直接合成一组真实照片单品。这些方法依赖输入约束,如参考掩码或显式类别提示。相比之下,约束集成生成要求模型在没有任何辅助结构指导的情况下导航庞大无结构数据库。因此,我们将它们排除在比较分析之外。 另一条平行研究路线探索更广泛时尚领域中的序列决策,但主要用于运营建模而非生成任务。例如,马尔可夫决策过程已被部署用于优化季节性产品的动态定价(2)和管理跨颜色变体的属性级库存风险(11)。(12)整合认知框架和决策模型,基于上下文选择集预测人类时尚选择。这些先验工作在结构化、低维状态和动作空间上运行,其中决策对应于有限的运营调整。相比之下,约束集成生成需要基于搜索的规划来导航组合爆炸式搜索空间,从而序列优化非单调潜在审美景观。 ## 3 方法论 ### 3.1 问题表述 我们将**约束集成生成**表述为有限时域确定性**马尔可夫决策过程**。令𝒳表示大规模时尚单品数据库。为保持置换不变性,状态空间𝒮定义为数据库幂集的子集,即𝒮⊆𝒫(𝒳)∖{∅}。一个回合从种子集成S₀⊂𝒳开始,其中|S₀|≥1。在每个离散步骤t,智能体选择单品Aₜ∈𝒳∖Sₜ,引发确定性转移:Sₜ₊₁=Sₜ∪{Aₜ}。经过T步后,过程到达终端状态Sₜ。 约束集成生成的关键方面在于**约束**概念由两个互补部分组成。第一部分是**显式约束**,记为𝒞^exp,包括种子集成、单品唯一性和基数限制。这些约束定义了可行解空间。相比之下,第二部分是**潜在约束**,记为𝒞^lat,捕捉时尚集成潜在的风格与结构规律。与显式约束不同,这些规律没有闭式形式,无法通过手工规则详尽编码;相反,必须从数据中推断。 在此表述下,中间状态转移产生零即时奖励,整体兼容性分数仅在终端状态评估。因此,约束集成生成旨在可行解空间内识别最大化其兼容性分数的最优终端集成S_T*: > S_T* = arg max_{S_T∈Ω(S₀;𝒞^exp)} Φ(S_T;𝒞^lat) (1) 其中Φ(·;𝒞^lat): 𝒮→ℝ是由潜在约束诱导的隐式兼容性评分映射,Ω(S₀;𝒞^exp)表示在显式约束下从S₀可达的所有可行集成集合。 约束集成生成的核心复杂性源于其双重约束结构:显式约束仅划定可行状态空间,而关键的风格规律保持隐式、非单调且缺乏闭式解析规范。因此,在此范式中识别最优集成S_T*在计算上不可行,因为搜索空间具有组合爆炸性质。为解决这一复杂问题,我们训练一个统一模型来提供状态价值估计与策略先验,并结合树搜索机制组合近优状态Ŝ_T。 > **图2**:统一序列组合模型架构。(a) 价值头估计集成的潜在潜力以指导长期协同。
相似文章
FashionLens:面向多样化时尚图像检索的任务自适应学习
FashionLens提出了一种统一的多模态大语言模型时尚图像检索框架,采用自适应校准与采样策略,在多种检索场景下实现了最先进的性能。
超越整体模型:深度多元时间序列预测的系统组件级基准测试
本文介绍了TSCOMP,一个大规模基准测试,系统地将深度多元时间序列预测方法分解为细粒度组件,以实现自动化模型选择,性能优于复杂的整体架构。
用于 Monte Carlo Tree Search 规划的因果对象中心模型
COMET 是一种基于模型的强化学习算法,结合了冻结的对象中心编码器、基于 Transformer 的世界模型和 Monte Carlo Tree Search,通过因果注意力聚焦于任务相关对象,在视觉强化学习基准上取得了更高分数。
FashionChameleon: 迈向实时交互式人体-服装视频定制
FashionChameleon 是一个实时交互式框架,用于人体-服装视频定制,采用教师-学生蒸馏和上下文学习技术,实现多服装切换并保持运动连贯性,在单个GPU上达到23.8 FPS。
在原生统一多模态模型中揭示理解-生成协同:从表示、任务到系统
本文探讨了统一多模态模型中视觉理解与生成之间的协同效应,表明任务解耦架构和端到端优化可以通过将共存转化为协同来提升性能。