稀疏自编码器实现CLIP模型的鲁棒且可解释的微调

Hugging Face Daily Papers 论文

摘要

SAE-FT提出了一种新颖的CLIP模型微调方法,利用稀疏自编码器约束来正则化视觉表示,在保持性能的同时提高对分布变化的鲁棒性,并实现可解释性。

大规模预训练的视觉-语言模型(如CLIP)在多种任务上展现出卓越的零样本性能。然而,微调这些模型以提升下游性能往往会降低对分布变化的鲁棒性。近期方法尝试缓解这一权衡,但通常依赖计算成本高昂的文本引导。我们提出了一种鲁棒微调的新方法SAE-FT,该方法仅作用于模型的视觉表示。SAE-FT通过惩罚添加或移除由在预训练模型上训练的稀疏自编码器识别的语义有意义的特征,来正则化这些表示的变化。这种约束防止了灾难性遗忘,并使微调过程可解释,从而能直接分析语义变化。SAE-FT在机制上透明且计算高效,在ImageNet及其关联的分布变化基准测试上达到或超越现有最佳性能。代码公开在:https://github.com/Fabian-Mor/sae-ft。
查看原文
查看缓存全文

缓存时间: 2026/05/18 14:26

论文页 - 稀疏自编码器实现CLIP模型的鲁棒可解释微调

来源:https://huggingface.co/papers/2605.15961

摘要

SAE-FT通过稀疏自编码器约束正则化视觉表示,实现了视觉语言模型的鲁棒微调,在提升性能的同时增强了对分布偏移的鲁棒性。

大规模预训练的视觉-语言模型(https://huggingface.co/papers?q=vision-language%20models)如CLIP(https://huggingface.co/papers?q=CLIP)在多种任务上展现出卓越的零样本性能。然而,微调(https://huggingface.co/papers?q=fine-tuning)这些模型以提升下游性能往往会削弱其对分布偏移(https://huggingface.co/papers?q=distribution%20shifts)的鲁棒性。近期方法试图缓解这一权衡,但通常依赖计算成本较高的文本引导。我们提出了一种新颖的鲁棒微调(https://huggingface.co/papers?q=fine-tuning)方法SAE-FT,该方法仅作用于模型的视觉表示(https://huggingface.co/papers?q=visual%20representations)。SAE-FT通过惩罚由预训练模型训练的稀疏自编码器(https://huggingface.co/papers?q=Sparse%20Autoencoder)识别出的语义有意义特征的添加和移除,来正则化这些表示的变化。这种约束防止了灾难性遗忘(https://huggingface.co/papers?q=catastrophic%20forgetting),并使微调(https://huggingface.co/papers?q=fine-tuning)过程具备可解释性,能够直接分析语义变化。SAE-FT在机制上透明且计算高效,在ImageNet及其相关分布偏移基准上的表现达到或超越了当前最优水平。代码已公开于:https://github.com/Fabian-Mor/sae-ft。

查看arXiv页面(https://arxiv.org/abs/2605.15961)查看PDF(https://arxiv.org/pdf/2605.15961)GitHub0(https://github.com/Fabian-Mor/sae-ft)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15961)

在您的agent中获取此论文:

hf papers read 2605.15961

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2605.15961,即可从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2605.15961,即可从此页面链接。

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2605.15961,即可从此页面链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。

相似文章

WriteSAE:面向循环状态的稀疏自编码器

Hugging Face Daily Papers

WriteSAE 引入了第一个稀疏自编码器,能够分解状态空间模型和混合循环语言模型中的矩阵缓存写入,相比现有方法实现了更优的令牌级干预。

用于可解释性分布外检测的稀疏自编码器

arXiv cs.LG

本文介绍了一种新颖的方法,利用稀疏自编码器(SAEs)从网络中间激活中学习可解释特征,用于分布外(OOD)检测,该方法达到了最先进的性能,并提供了关于分布偏移如何影响所学表示的见解。

用于特征发现与长上下文归因的回合平均SAEs

arXiv cs.CL

本文介绍了基于回合平均的稀疏自编码器(SAEs),该编码器基于对话回合的平均激活值运行,能够实现长上下文的高效特征发现与归因图。此外,本文还提出了一种嵌套架构,用于与每个词元的特征联合训练。

Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs

Hugging Face Daily Papers

# Paper page - Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs Source: [https://huggingface.co/papers/2605.07447](https://huggingface.co/papers/2605.07447) ## Abstract SAEgis detects adversarial attacks on vision\-language models using sparse autoencoders trained for reconstruction, achieving strong performance across domains without additional training\. [Vision\-language models](https://huggingface.co/papers?q=Vision-language%20models)\(VLMs\) have advan