ZooClaw-FashionSigLIP2:基于蒸馏微调的鲁棒时尚检索

Hugging Face Daily Papers 论文

摘要

本文介绍了ZooClaw-FashionSigLIP2,一个专注于时尚领域的视觉-语言模型,它通过全微调、知识蒸馏和权重插值实现了卓越的检索性能,超越了更大的骨干网络和LoRA。此外,本文还发布了一个新的高质量基准测试ZooClaw-Fashion,并分析了现有数据集中的结构性偏差。

将基础视觉-语言编码器适配到专门的检索任务中存在一个根本性的权衡:目标分布上的性能提升会以牺牲基础模型的广泛泛化能力为代价,而时尚检索正是这一问题的典型实例。我们提出了ZooClaw-FashionSigLIP2,一个专注于时尚领域的SigLIP2-base模型,通过一个简单的方法解决了这一权衡——在精心整理的领域内数据上进行全微调并配合知识蒸馏,随后通过\wiseft~wortsman2022wiseft权重插值与基础模型进行插值——该方法优于LoRA、更大的骨干网络(高达1B参数)以及外部训练数据。在公平评估下,ZooClaw-FashionSigLIP2在我们测试套件中的所有基准测试上均优于所有基线模型。此外,我们还发布了ZooClaw-Fashion,一个高质量的新型时尚检索基准测试,并对广泛使用的基准测试进行了系统性质量分析,揭示了其公开真实标签中的结构性偏差并加以缓解。我们开源了模型权重和所有评估工具,以促进未来的研究。
查看原文
查看缓存全文

缓存时间: 2026/06/30 11:35

论文页面 - ZooClaw-FashionSigLIP2:用于稳健时尚检索的蒸馏微调

来源:https://huggingface.co/papers/2606.27708

摘要

一个专用于时尚领域的视觉语言模型,通过结合知识蒸馏与权重插值的全量微调,在新基准上实现了优于现有方法的检索性能,同时解决了已有数据集中的结构偏差问题。

将基础视觉语言编码器(https://huggingface.co/papers?q=vision-language%20encoder)适配到专门检索任务时会产生一个根本性权衡:目标分布上的提升以牺牲基础模型的广泛泛化能力为代价,而时尚检索(https://huggingface.co/papers?q=fashion%20retrieval)正是这一问题的典型实例。我们提出 ZooClaw-FashionSigLIP2,一个专用于时尚领域的 SigLIP2-base(https://huggingface.co/papers?q=SigLIP2-base)模型,通过一个简单方案——在精心策划的域内数据上进行全量微调(https://huggingface.co/papers?q=full%20fine-tuning)与知识蒸馏(https://huggingface.co/papers?q=knowledge%20distillation),随后与基础模型进行权重插值(https://huggingface.co/papers?q=weight%20interpolation)(参考 wortsman2022wiseft)——解决了这一权衡,并优于 LoRA(https://huggingface.co/papers?q=LoRA)、更大的骨干网络(高达 1B 参数)以及外部训练数据。在公平评估下,ZooClaw-FashionSigLIP2 在我们的测试套件中每个基准上都优于所有基线。此外,我们发布了 ZooClaw-Fashion,一个高质量的新时尚检索(https://huggingface.co/papers?q=fashion%20retrieval)基准,以及对广泛使用基准的系统性质量分析,该分析揭示并缓解了其公开真值(https://huggingface.co/papers?q=ground%20truth)中存在的结构性偏差。我们开源模型权重及所有评估工件,以促进未来研究。

查看 arXiv 页面(https://arxiv.org/abs/2606.27708)查看 PDF(https://arxiv.org/pdf/2606.27708)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.27708)

在您的代理中获取此论文:

hf papers read 2606\.27708

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.27708 可将其链接到此页面。

引用本文的数据集0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.27708 可将其链接到此页面。

引用本文的 Space0

暂无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.27708 可将其链接到此页面。

包含本文的收藏集0

暂无收藏集包含此论文

将本文添加至收藏集(https://huggingface.co/new-collection)可将其链接到此页面。

相似文章

DataClaw0:从原始流中智能裁剪多模态数据

Hugging Face Daily Papers

DataClaw0提出了一种智能数据裁剪范式,利用可学习的数据处理来结构化高熵多模态流,通过在一个新型基准上进行SFT和GRPO实现了稳健的对齐。

削减视觉世界建模评估的长尾

Hugging Face Daily Papers

本文介绍了Tailor-Bench,这是一个系统评估视觉世界模型在不规则物理交互上的基准,揭示了泛化中的长尾差距:模型在常见场景上表现良好,但在非常规和不可能场景上性能下降。

DataComp-VLM:面向视觉语言模型的改进型开放数据集

Hugging Face Daily Papers

本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。