隐形捷径:视觉编码器为何洞悉你的相机
摘要
本文识别了像素级别的隐形元数据痕迹,这些痕迹被视觉编码器用作捷径,导致在元数据分布偏移下出现性能下降。在预训练期间和之后采取的缓解策略,能降低对目标元数据和未见元数据的敏感性,同时不牺牲下游性能。
查看缓存全文
缓存时间: 2026/08/07 05:55
论文页面 - 不可见的捷径:为什么视觉编码器知道你的相机
来源:https://huggingface.co/papers/2608.05424
摘要
深度视觉模型会利用捷径(shortcuts),依赖与监督信号相关的线索。以往的工作主要关注可见的偏差,例如物体-背景或纹理相关性。我们发现了捷径学习中一个不同的来源:像素级别嵌入的不可见元数据痕迹,这些元数据包括图像处理和照片采集等。我们假设,大规模语义监督(无论是通过类别标签 ImageNet 还是十亿级图文对 LAION)在预训练期间会自然地引入元数据-语义相关性,促使模型将低层信号转化为预测性特征。通过引入受控的元数据-语义相关性,我们证明更强的相关性会导致模型对元数据痕迹的系统性更高敏感性,并在元数据分布偏移下造成更大的性能下降。我们进一步探索了在预训练期间和之后应用的缓解策略,这些策略不仅降低了对目标元数据的敏感性,还降低了对未见元数据的敏感性,且不牺牲下游任务的性能。元数据敏感性也有积极的一面:它部分解释了一些编码器强大的生成图像检测能力,而缓解这种敏感性可以提高分布外泛化能力。代码:https://github.com/ryan-caesar-ramos/visual-encoder-traces
查看 arXiv 页面 (https://arxiv.org/abs/2608.05424) 查看 PDF (https://arxiv.org/pdf/2608.05424) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05424)
引用该论文的模型
0
暂无模型关联该论文
在模型 README.md 中引用 arxiv.org/abs/2608.05424 即可从本页面链接到该模型。
引用该论文的数据集
0
暂无数据集关联该论文
在数据集 README.md 中引用 arxiv.org/abs/2608.05424 即可从本页面链接到该数据集。
引用该论文的 Space
0
暂无 Space 关联该论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.05424 即可从本页面链接到该 Space。
收录该论文的集合
0
暂无集合收录该论文
将该论文添加到集合 (https://huggingface.co/new-collection) 中,即可从本页面链接到该集合。
相似文章
基于摄像头所见采取行动的智能体:空间输出是薄弱环节
VideoDB 的一位开发者强调了智能体使用视觉模型时精确空间输出的问题,指出微小的定位错误可能导致错误动作,并宣布开源了一个评估工具,用于在自定义视频上检查空间准确性。
LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放
LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。
@andimarafioti:没有视觉编码器,VLM也能‘看见’吗?我们受Gemma 4 12B启发,花100美元训练了一个。在M3 Pro MacBook上的延迟:…
研究人员受Gemma 4 12B启发,仅花费100美元训练了一个无需视觉编码器的视觉语言模型,在M3 Pro MacBook上实现了端到端延迟降低30%。
Stateful Visual Encoders for Vision-Language Models
本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。
ReVision:通过时间视觉冗余缩减扩展计算机使用智能体
本文介绍了 ReVision,一种通过从连续屏幕截图中移除冗余视觉块来减少计算机使用智能体 token 使用量的方法。研究表明,这种效率提升使得智能体能够处理更长的轨迹,并在 OSWorld 等基准测试中提高性能。