自然图像对比学习理论

Hugging Face Daily Papers 论文

摘要

本文通过分析计算,针对基本数据增强和具有平稳统计特性的自然图像,在对比损失下得到了最优表示。结果表明,最优CNN的第一层滤波器是正弦波,且权重可通过注水算法计算。

为什么对简单图像进行对比学习和数据增强能为下游任务产生有用的表示?我们通过分析计算,针对一系列基本数据增强和任何具有平稳统计特性的图像数据集,在对比损失下得到了最优表示。我们证明,对于某些数据增强,最优表示可以通过一个CNN实现,其第一层滤波器为正弦波,后接逐点非线性变换、全局平均池化和一个执行部分白化的最终线性层。我们还表明,对于更复杂的数据增强,此类CNN中的最优权重仍然是正弦波。给定数据集的期望功率谱,可以使用简单的注水算法计算正弦波的频率及其权重。在不同图像数据集和数据增强上的实验表明,此类使用SGD训练的CNN在第一层经验性地学习到正弦波并执行部分白化。
查看原文
查看缓存全文

缓存时间: 2026/07/14 20:17

论文页面 - 基于自然图像的对比学习理论

来源:https://huggingface.co/papers/2607.07470
发布于7月8日

·

由 https://huggingface.co/ShadenA 提交

Shaden (https://huggingface.co/ShadenA) 于7月14日

摘要

为什么通过简单图像和增强进行的对比学习能为下游任务产生有用的表征?我们通过针对一系列基本增强操作和任意具有平稳统计特性的图像数据集,以解析方式计算对比损失的最优表征来回答这个问题。我们证明,对于某些增强操作,最优解可通过一个CNN达到:其第一层滤波器为正弦波,随后是逐点非线性变换、全局平均池化,以及执行部分白化的最终线性层。我们还证明,在更复杂增强操作下,此类CNN中的最优权重仍为正弦波。给定数据集的期望功率谱后,可通过简单的注水算法计算这些正弦波的频率及其权重。针对不同图像数据集和增强操作的实验表明,此类CNN在使用SGD训练时,经验上会在第一层学习到正弦波并执行部分白化。

查看arXiv页面 (https://arxiv.org/abs/2607.07470)
查看PDF (https://arxiv.org/pdf/2607.07470)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.07470)

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.07470,以便从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.07470,以便从此页面链接。

引用此论文的Space0

没有Space链接此论文

请在Space README.md 中引用 arxiv.org/abs/2607.07470,以便从此页面链接。

包含此论文的合集1

相似文章

损失不足:对比表示学习中的采样条件与归纳偏置

arXiv cs.LG

本文发展了一个测度论框架,分析对比学习何时恢复有意义的潜在几何结构,引入了正对采样的'多样性条件'和一个支持修正的InfoNCE变体。实验表明,采样多样性与架构归纳偏置在对比表示学习中存在关键交互。

加权对比学习的统一几何框架

arXiv cs.LG

本文提出了一个统一的几何框架,证明加权InfoNCE目标可以解释为距离几何问题,从而精确刻画了有监督和弱监督对比学习方法的最优嵌入,并揭示了这些嵌入何时在几何上可实现、退化或不一致。

草图线性对比学习:近似、优化与统计缩放

arXiv cs.LG

本文推导了在高斯潜变量模型下的草图线性对比学习的缩放定律,分析了风险如何分解为近似项、优化项和统计项,并为对比学习中平衡模型规模、数据和计算提供了理论指导。

反馈对齐在卷积网络中的生物合理性与表征一致性

arXiv cs.AI

本文评估了反馈对齐算法在卷积网络中的生物合理性与表征一致性,并在 CIFAR-10 数据集上将其与标准反向传播进行了对比。作者发现,改进的反馈对齐方法收敛出的内部表征与反向传播产生的表征相似,这表明其功能上的成功源于对表征几何结构的模仿。

基于隐式神经表示的数据驱动视频编解码器

arXiv cs.AI

本文提出一种视频编解码器,将视频和音频存储为正弦表示网络(SIREN)的权重,利用知识蒸馏和量化进行压缩。实验显示,与原始网络相比压缩比为2.61倍,但质量落后于H.264和HEVC等标准编解码器。