FashionLens:面向多样化时尚图像检索的任务自适应学习

Hugging Face Daily Papers 论文

摘要

FashionLens提出了一种统一的多模态大语言模型时尚图像检索框架,采用自适应校准与采样策略,在多种检索场景下实现了最先进的性能。

时尚图像检索是现代电子商务系统的基石。在实践中,一个能够支持多种查询格式和搜索意图的统一框架备受期待。然而,现有方法专注于狭窄的检索任务,未能充分捕捉这种多样性。因此,在本工作中,我们旨在开发一个能够处理多种现实时尚检索场景的统一框架,实现真正多样化的时尚图像检索。为了建立数据基础,我们首先引入了U-FIRE,这是一个全面的基准测试,它将分散的时尚数据集整合为一个统一的集合,并辅以两个手动整理的数据集用于测试泛化能力。基于此,我们提出了FashionLens,一个基于多模态大语言模型的统一框架。为了处理不同的匹配目标,我们设计了一个Proposal-Guided Spherical Query Calibrator,通过自适应球面线性插值动态地将查询表示转移到任务对齐的度量空间中。此外,为了缓解由不同任务复杂度和数据规模引起的优化不平衡,我们开发了一种Gradient-Guided Adaptive Sampling策略,该策略根据实时学习难度和数据规模先验自动重新加权任务。在U-FIRE上的实验表明,FashionLens在多种检索场景下实现了最先进的性能,并且对未见过的任务具有鲁棒性。数据和代码已在https://github.com/haokunwen/FashionLens上公开发布。
查看原文
查看缓存全文

缓存时间: 2026/05/22 14:20

论文页面 - FashionLens: 面向通用时尚图像检索的任务自适应学习

来源:https://huggingface.co/papers/2605.22552

摘要

本文提出了一种统一的时尚图像检索框架,通过多模态大语言模型结合自适应校准与采样策略,能够处理多样化的查询格式与搜索意图。

时尚图像检索 (https://huggingface.co/papers?q=Fashion%20image%20retrieval) 是现代电商系统的基石。在实际应用中,一种能够支持多样化查询格式与搜索意图的统一框架 (https://huggingface.co/papers?q=unified%20framework) 备受期待。然而,现有方法仅聚焦于狭窄的检索任务,未能充分捕捉这种多样性。因此,本文旨在开发一个能够处理多样化现实时尚检索场景的统一框架 (https://huggingface.co/papers?q=unified%20framework),从而实现真正通用的时尚图像检索 (https://huggingface.co/papers?q=fashion%20image%20retrieval)。为了建立数据基础,我们首先引入了 U-FIRE,这是一个综合性的基准测试,将分散的时尚数据集整合为统一集合,并辅以两个人工标注的数据集用于测试泛化能力。在此基础上,我们提出了 FashionLens,这是一个基于多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models) 的统一框架 (https://huggingface.co/papers?q=unified%20framework)。为了处理不同的匹配目标,我们设计了一种提案引导的球面查询校准器 (https://huggingface.co/papers?q=Proposal-Guided%20Spherical%20Query%20Calibrator),通过自适应球形线性插值,动态地将查询表示转换到任务对齐的度量空间中。此外,为了缓解由任务复杂度和数据规模差异导致的优化不平衡,我们开发了一种梯度引导的自适应采样 (https://huggingface.co/papers?q=Gradient-Guided%20Adaptive%20Sampling) 策略,该策略能够根据实时学习难度和数据规模先验自动重新加权任务。在 U-FIRE 上的实验表明,FashionLens 在多种检索场景中均取得了最先进的性能,并且能够稳健地泛化到未见任务。数据和代码已在 https://github.com/haokunwen/FashionLens 公开发布。

查看 arXiv 页面 (https://arxiv.org/abs/2605.22552)查看 PDF (https://arxiv.org/pdf/2605.22552)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.22552)

在您的 agent 中获取此论文:

hf papers read 2605.22552

没有最新 CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

无模型链接到此论文

在模型的 README.md 中引用 arxiv.org/abs/2605.22552 以从此页面链接。

引用本论文的数据集0

无数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.22552 以从此页面链接。

引用本论文的 Space0

无 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.22552 以从此页面链接。

包含本论文的收藏0

无收藏包含本论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

ZooClaw-FashionSigLIP2:基于蒸馏微调的鲁棒时尚检索

Hugging Face Daily Papers

本文介绍了ZooClaw-FashionSigLIP2,一个专注于时尚领域的视觉-语言模型,它通过全微调、知识蒸馏和权重插值实现了卓越的检索性能,超越了更大的骨干网络和LoRA。此外,本文还发布了一个新的高质量基准测试ZooClaw-Fashion,并分析了现有数据集中的结构性偏差。

ModelLens:从海量模型中为特定任务甄选最优解

Hugging Face Daily Papers

ModelLens 是一个统一框架,通过利用公开排行榜数据为未见数据集推荐 AI 模型,从而避免了昂贵的直接评估需求。该框架构建了一个性能感知的潜在空间,以在多样化任务中对候选模型进行排序,并在大规模基准测试中超越了现有基线方法。

Lens:重新思考基础文本到图像模型的训练效率

Hugging Face Daily Papers

Lens是微软推出的一款紧凑型38亿参数文本到图像模型,在训练计算量显著降低的同时,通过密集描述、多分辨率批处理和高效架构,达到了与更大模型竞争甚至超越的性能。