ZooClaw-FashionSigLIP2:基于蒸馏微调的鲁棒时尚检索
摘要
本文介绍了ZooClaw-FashionSigLIP2,一个专注于时尚领域的视觉-语言模型,它通过全微调、知识蒸馏和权重插值实现了卓越的检索性能,超越了更大的骨干网络和LoRA。此外,本文还发布了一个新的高质量基准测试ZooClaw-Fashion,并分析了现有数据集中的结构性偏差。
查看缓存全文
缓存时间: 2026/06/30 11:35
论文页面 - ZooClaw-FashionSigLIP2:用于稳健时尚检索的蒸馏微调
来源:https://huggingface.co/papers/2606.27708
摘要
一个专用于时尚领域的视觉语言模型,通过结合知识蒸馏与权重插值的全量微调,在新基准上实现了优于现有方法的检索性能,同时解决了已有数据集中的结构偏差问题。
将基础视觉语言编码器(https://huggingface.co/papers?q=vision-language%20encoder)适配到专门检索任务时会产生一个根本性权衡:目标分布上的提升以牺牲基础模型的广泛泛化能力为代价,而时尚检索(https://huggingface.co/papers?q=fashion%20retrieval)正是这一问题的典型实例。我们提出 ZooClaw-FashionSigLIP2,一个专用于时尚领域的 SigLIP2-base(https://huggingface.co/papers?q=SigLIP2-base)模型,通过一个简单方案——在精心策划的域内数据上进行全量微调(https://huggingface.co/papers?q=full%20fine-tuning)与知识蒸馏(https://huggingface.co/papers?q=knowledge%20distillation),随后与基础模型进行权重插值(https://huggingface.co/papers?q=weight%20interpolation)(参考 wortsman2022wiseft)——解决了这一权衡,并优于 LoRA(https://huggingface.co/papers?q=LoRA)、更大的骨干网络(高达 1B 参数)以及外部训练数据。在公平评估下,ZooClaw-FashionSigLIP2 在我们的测试套件中每个基准上都优于所有基线。此外,我们发布了 ZooClaw-Fashion,一个高质量的新时尚检索(https://huggingface.co/papers?q=fashion%20retrieval)基准,以及对广泛使用基准的系统性质量分析,该分析揭示并缓解了其公开真值(https://huggingface.co/papers?q=ground%20truth)中存在的结构性偏差。我们开源模型权重及所有评估工件,以促进未来研究。
查看 arXiv 页面(https://arxiv.org/abs/2606.27708)查看 PDF(https://arxiv.org/pdf/2606.27708)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.27708)
在您的代理中获取此论文:
hf papers read 2606\.27708
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.27708 可将其链接到此页面。
引用本文的数据集0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.27708 可将其链接到此页面。
引用本文的 Space0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.27708 可将其链接到此页面。
包含本文的收藏集0
暂无收藏集包含此论文
将本文添加至收藏集(https://huggingface.co/new-collection)可将其链接到此页面。
相似文章
FashionLens:面向多样化时尚图像检索的任务自适应学习
FashionLens提出了一种统一的多模态大语言模型时尚图像检索框架,采用自适应校准与采样策略,在多种检索场景下实现了最先进的性能。
DataClaw0:从原始流中智能裁剪多模态数据
DataClaw0提出了一种智能数据裁剪范式,利用可学习的数据处理来结构化高熵多模态流,通过在一个新型基准上进行SFT和GRPO实现了稳健的对齐。
削减视觉世界建模评估的长尾
本文介绍了Tailor-Bench,这是一个系统评估视觉世界模型在不规则物理交互上的基准,揭示了泛化中的长尾差距:模型在常见场景上表现良好,但在非常规和不可能场景上性能下降。
LingBot-Vision: 基于掩码边界建模的自监督预训练 (在1.1B参数下NYUv2线性探测RMSE为0.296,对比DINOv3-7B的0.309,在ImageNet上稍逊一筹);提供四种尺寸的权重[R]
LingBot-Vision引入了掩码边界建模用于自监督预训练,在1.1B参数下NYUv2线性探测上达到0.296 RMSE,而DINOv3-7B为0.309,虽然在ImageNet上表现稍逊;已发布四种尺寸的权重。
DataComp-VLM:面向视觉语言模型的改进型开放数据集
本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。