隐形捷径:视觉编码器为何洞悉你的相机

Hugging Face Daily Papers 论文

摘要

本文识别了像素级别的隐形元数据痕迹,这些痕迹被视觉编码器用作捷径,导致在元数据分布偏移下出现性能下降。在预训练期间和之后采取的缓解策略,能降低对目标元数据和未见元数据的敏感性,同时不牺牲下游性能。

深度视觉模型会利用捷径,依赖与监督信号相关的线索。先前的工作主要关注可见的偏差,例如目标-背景或纹理相关性。我们发现了捷径学习的另一种来源:嵌入在像素级别的隐形元数据痕迹,这些元数据涉及图像处理和照片采集等。我们假设,大规模语义监督——无论是通过类别标签(ImageNet)还是十亿级图文对(LAION)——在预训练期间会自然引发元数据-语义相关性,使模型将低级信号转化为预测性特征。通过引入受控的元数据-语义相关性,我们证明相关性越强,模型对元数据痕迹的敏感性系统性地越高,且在元数据分布偏移下的性能下降也越大。我们进一步探索了在预训练期间和之后应用的缓解策略,这些策略不仅降低了对目标元数据的敏感性,也降低了对未见元数据的敏感性,同时不牺牲下游任务的性能。元数据敏感性也有积极的一面:它部分解释了一些编码器强大的生成图像检测能力,而缓解这种敏感性可以改善分布外泛化。代码:https://github.com/ryan-caesar-ramos/visual-encoder-traces
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:55

论文页面 - 不可见的捷径:为什么视觉编码器知道你的相机

来源:https://huggingface.co/papers/2608.05424

摘要

深度视觉模型会利用捷径(shortcuts),依赖与监督信号相关的线索。以往的工作主要关注可见的偏差,例如物体-背景或纹理相关性。我们发现了捷径学习中一个不同的来源:像素级别嵌入的不可见元数据痕迹,这些元数据包括图像处理和照片采集等。我们假设,大规模语义监督(无论是通过类别标签 ImageNet 还是十亿级图文对 LAION)在预训练期间会自然地引入元数据-语义相关性,促使模型将低层信号转化为预测性特征。通过引入受控的元数据-语义相关性,我们证明更强的相关性会导致模型对元数据痕迹的系统性更高敏感性,并在元数据分布偏移下造成更大的性能下降。我们进一步探索了在预训练期间和之后应用的缓解策略,这些策略不仅降低了对目标元数据的敏感性,还降低了对未见元数据的敏感性,且不牺牲下游任务的性能。元数据敏感性也有积极的一面:它部分解释了一些编码器强大的生成图像检测能力,而缓解这种敏感性可以提高分布外泛化能力。代码:https://github.com/ryan-caesar-ramos/visual-encoder-traces

查看 arXiv 页面 (https://arxiv.org/abs/2608.05424) 查看 PDF (https://arxiv.org/pdf/2608.05424) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05424)

引用该论文的模型

0

暂无模型关联该论文

在模型 README.md 中引用 arxiv.org/abs/2608.05424 即可从本页面链接到该模型。

引用该论文的数据集

0

暂无数据集关联该论文

在数据集 README.md 中引用 arxiv.org/abs/2608.05424 即可从本页面链接到该数据集。

引用该论文的 Space

0

暂无 Space 关联该论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.05424 即可从本页面链接到该 Space。

收录该论文的集合

0

暂无集合收录该论文

将该论文添加到集合 (https://huggingface.co/new-collection) 中,即可从本页面链接到该集合。

相似文章

LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放

Hugging Face Daily Papers

LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。

Stateful Visual Encoders for Vision-Language Models

Hugging Face Daily Papers

本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。

ReVision:通过时间视觉冗余缩减扩展计算机使用智能体

arXiv cs.CL

本文介绍了 ReVision,一种通过从连续屏幕截图中移除冗余视觉块来减少计算机使用智能体 token 使用量的方法。研究表明,这种效率提升使得智能体能够处理更长的轨迹,并在 OSWorld 等基准测试中提高性能。