FashionLens:面向多样化时尚图像检索的任务自适应学习
摘要
FashionLens提出了一种统一的多模态大语言模型时尚图像检索框架,采用自适应校准与采样策略,在多种检索场景下实现了最先进的性能。
查看缓存全文
缓存时间: 2026/05/22 14:20
论文页面 - FashionLens: 面向通用时尚图像检索的任务自适应学习
来源:https://huggingface.co/papers/2605.22552
摘要
本文提出了一种统一的时尚图像检索框架,通过多模态大语言模型结合自适应校准与采样策略,能够处理多样化的查询格式与搜索意图。
时尚图像检索 (https://huggingface.co/papers?q=Fashion%20image%20retrieval) 是现代电商系统的基石。在实际应用中,一种能够支持多样化查询格式与搜索意图的统一框架 (https://huggingface.co/papers?q=unified%20framework) 备受期待。然而,现有方法仅聚焦于狭窄的检索任务,未能充分捕捉这种多样性。因此,本文旨在开发一个能够处理多样化现实时尚检索场景的统一框架 (https://huggingface.co/papers?q=unified%20framework),从而实现真正通用的时尚图像检索 (https://huggingface.co/papers?q=fashion%20image%20retrieval)。为了建立数据基础,我们首先引入了 U-FIRE,这是一个综合性的基准测试,将分散的时尚数据集整合为统一集合,并辅以两个人工标注的数据集用于测试泛化能力。在此基础上,我们提出了 FashionLens,这是一个基于多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models) 的统一框架 (https://huggingface.co/papers?q=unified%20framework)。为了处理不同的匹配目标,我们设计了一种提案引导的球面查询校准器 (https://huggingface.co/papers?q=Proposal-Guided%20Spherical%20Query%20Calibrator),通过自适应球形线性插值,动态地将查询表示转换到任务对齐的度量空间中。此外,为了缓解由任务复杂度和数据规模差异导致的优化不平衡,我们开发了一种梯度引导的自适应采样 (https://huggingface.co/papers?q=Gradient-Guided%20Adaptive%20Sampling) 策略,该策略能够根据实时学习难度和数据规模先验自动重新加权任务。在 U-FIRE 上的实验表明,FashionLens 在多种检索场景中均取得了最先进的性能,并且能够稳健地泛化到未见任务。数据和代码已在 https://github.com/haokunwen/FashionLens 公开发布。
查看 arXiv 页面 (https://arxiv.org/abs/2605.22552)查看 PDF (https://arxiv.org/pdf/2605.22552)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.22552)
在您的 agent 中获取此论文:
hf papers read 2605.22552
没有最新 CLI? curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
无模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.22552 以从此页面链接。
引用本论文的数据集0
无数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.22552 以从此页面链接。
引用本论文的 Space0
无 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.22552 以从此页面链接。
包含本论文的收藏0
无收藏包含本论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
ZooClaw-FashionSigLIP2:基于蒸馏微调的鲁棒时尚检索
本文介绍了ZooClaw-FashionSigLIP2,一个专注于时尚领域的视觉-语言模型,它通过全微调、知识蒸馏和权重插值实现了卓越的检索性能,超越了更大的骨干网络和LoRA。此外,本文还发布了一个新的高质量基准测试ZooClaw-Fashion,并分析了现有数据集中的结构性偏差。
ModelLens:从海量模型中为特定任务甄选最优解
ModelLens 是一个统一框架,通过利用公开排行榜数据为未见数据集推荐 AI 模型,从而避免了昂贵的直接评估需求。该框架构建了一个性能感知的潜在空间,以在多样化任务中对候选模型进行排序,并在大规模基准测试中超越了现有基线方法。
Lens:重新思考基础文本到图像模型的训练效率
Lens是微软推出的一款紧凑型38亿参数文本到图像模型,在训练计算量显著降低的同时,通过密集描述、多分辨率批处理和高效架构,达到了与更大模型竞争甚至超越的性能。
AFMRL:电商中属性增强的细粒度多模态表征学习
阿里巴巴研究人员提出 AFMRL,一种两阶段框架,利用 MLLM 提取商品属性,增强细粒度多模态表征学习,用于电商检索任务。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。