稀疏自编码器实现CLIP模型的鲁棒且可解释的微调
摘要
SAE-FT提出了一种新颖的CLIP模型微调方法,利用稀疏自编码器约束来正则化视觉表示,在保持性能的同时提高对分布变化的鲁棒性,并实现可解释性。
查看缓存全文
缓存时间: 2026/05/18 14:26
论文页 - 稀疏自编码器实现CLIP模型的鲁棒可解释微调
来源:https://huggingface.co/papers/2605.15961
摘要
SAE-FT通过稀疏自编码器约束正则化视觉表示,实现了视觉语言模型的鲁棒微调,在提升性能的同时增强了对分布偏移的鲁棒性。
大规模预训练的视觉-语言模型(https://huggingface.co/papers?q=vision-language%20models)如CLIP(https://huggingface.co/papers?q=CLIP)在多种任务上展现出卓越的零样本性能。然而,微调(https://huggingface.co/papers?q=fine-tuning)这些模型以提升下游性能往往会削弱其对分布偏移(https://huggingface.co/papers?q=distribution%20shifts)的鲁棒性。近期方法试图缓解这一权衡,但通常依赖计算成本较高的文本引导。我们提出了一种新颖的鲁棒微调(https://huggingface.co/papers?q=fine-tuning)方法SAE-FT,该方法仅作用于模型的视觉表示(https://huggingface.co/papers?q=visual%20representations)。SAE-FT通过惩罚由预训练模型训练的稀疏自编码器(https://huggingface.co/papers?q=Sparse%20Autoencoder)识别出的语义有意义特征的添加和移除,来正则化这些表示的变化。这种约束防止了灾难性遗忘(https://huggingface.co/papers?q=catastrophic%20forgetting),并使微调(https://huggingface.co/papers?q=fine-tuning)过程具备可解释性,能够直接分析语义变化。SAE-FT在机制上透明且计算高效,在ImageNet及其相关分布偏移基准上的表现达到或超越了当前最优水平。代码已公开于:https://github.com/Fabian-Mor/sae-ft。
查看arXiv页面(https://arxiv.org/abs/2605.15961)查看PDF(https://arxiv.org/pdf/2605.15961)GitHub0(https://github.com/Fabian-Mor/sae-ft)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15961)
在您的agent中获取此论文:
hf papers read 2605.15961
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2605.15961,即可从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2605.15961,即可从此页面链接。
引用此论文的Space0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2605.15961,即可从此页面链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。
相似文章
WriteSAE:面向循环状态的稀疏自编码器
WriteSAE 引入了第一个稀疏自编码器,能够分解状态空间模型和混合循环语言模型中的矩阵缓存写入,相比现有方法实现了更优的令牌级干预。
用于可解释性分布外检测的稀疏自编码器
本文介绍了一种新颖的方法,利用稀疏自编码器(SAEs)从网络中间激活中学习可解释特征,用于分布外(OOD)检测,该方法达到了最先进的性能,并提供了关于分布偏移如何影响所学表示的见解。
使用稀疏自编码器发现数百万个可解释特征
本文介绍了Qwen3-Instruct SAE,这是一套基于Qwen3指令微调模型训练的稀疏自编码器,能够发现数百万个可解释特征,并展示了拒绝引导能力。
用于特征发现与长上下文归因的回合平均SAEs
本文介绍了基于回合平均的稀疏自编码器(SAEs),该编码器基于对话回合的平均激活值运行,能够实现长上下文的高效特征发现与归因图。此外,本文还提出了一种嵌套架构,用于与每个词元的特征联合训练。
Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
# Paper page - Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs Source: [https://huggingface.co/papers/2605.07447](https://huggingface.co/papers/2605.07447) ## Abstract SAEgis detects adversarial attacks on vision\-language models using sparse autoencoders trained for reconstruction, achieving strong performance across domains without additional training\. [Vision\-language models](https://huggingface.co/papers?q=Vision-language%20models)\(VLMs\) have advan