数据增强如何塑造神经表征

arXiv cs.LG 论文

摘要

本文利用形状分析工具,刻画了不同数据增强策略如何重塑神经网络表征的几何结构,发现增强强度和类型会在形状空间中产生截然不同且具有良好规律的轨迹。

arXiv:2605.15306v1 公告类型:新 摘要:数据增强被广泛认为能够提升深度网络的泛化能力,但其对学习表征几何结构的影响仍知之甚少。本研究刻画了不同数据增强策略如何重塑神经网络的内部表征。通过使用形状分析工具,我们将网络隐藏表征嵌入到一个度量空间中,该空间的距离对缩放、平移、旋转和反射具有不变性。我们发现,增强强度的增加会在该空间中产生具有良好规律的轨迹,且不同增强类型会将表征引导至不同的方向。此外,我们研究了神经表征形状如何沿数据增强轨迹发生扭曲,并表明神经几何的见解能够预测哪些表征在模型集成时能带来最大的改进。我们的结果揭示了不同架构和随机种子之间共享的几何模式,并表明分析形状空间轨迹为理解和比较数据增强方法提供了一种原则性工具。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:39

# 数据增强如何塑造神经表征
来源:https://arxiv.org/html/2605.15306
Tianxiao He 计算机科学系 纽约大学 New York, NY 10012 USA th3129@nyu\.edu & Alex H\. Williams 神经科学中心 纽约大学 New York, NY 10012 USA aw4614@nyu\.edu Sarah E\. Harvey 弗拉特铁龙研究所 New York, NY 10010, USA sharvey@flatironinstitute\.org

###### 摘要

数据增强被广泛认为能提升深度网络的泛化能力,但其对学习表征几何结构的影响仍知之甚少。本文中,我们描述了不同数据增强策略如何重塑神经网络中的内部表征。利用形状分析工具,我们将网络隐藏表征嵌入到一个度量空间中,该空间中距离对缩放、平移、旋转和反射具有不变性。我们发现,增强强度的增加在该空间中形成良定义的轨迹,且不同的增强类型将表征引导至不同的方向。此外,我们研究了数据增强轨迹中神经表征形状的畸变方式,并展示了神经几何学的见解如何预测哪些表征在模型集成时能带来最大改进。我们的结果揭示了跨架构和随机种子的共享几何模式,并表明分析形状空间轨迹为理解和比较数据增强方法提供了原理性工具。开源代码可在 https://anonymous\.4open\.science/r/netrep\-analysis\-00EC 获取。

## 1 引言

由于深度神经网络的过度参数化特性,许多超参数设置往往能实现相似的任务性能。调整学习率、批量大小和动量等超参数已知对性能至关重要[24 (https://arxiv.org/html/2605.15306#bib.bib17)],但关于这些选择如何改变学习到的神经表征几何结构的研究却很少。特别是,当隔离一个超参数并逐步变化时,隐藏层活动的特征如何变化?

研究这一现象的一个特别丰富的领域是数据增强。数据增强是一种基础技术,通过简单的变换来多样化现有数据集,从而提升深度网络的性能[23 (https://arxiv.org/html/2605.15306#bib.bib32)]。在计算机视觉背景下,经典的数据增强技术包括旋转、裁剪、颜色抖动以及向部分输入图像添加高斯噪声。数据增强通常被解释为一种隐式正则化技术[4 (https://arxiv.org/html/2605.15306#bib.bib29)],或者是在任务中融入不变性的先验知识[18 (https://arxiv.org/html/2605.15306#bib.bib22),3 (https://arxiv.org/html/2605.15306#bib.bib23)]。尽管数据增强在现代训练流程中处于核心地位,但通常通过简单的启发式方法或优化任务性能的搜索来调整。然而,许多不同的增强超参数组合,如强度、概率或空间范围,可能在留存数据上产生几乎相同的准确率。这种简并性表明,仅凭性能指标可能掩盖不同训练协议下模型学习表示世界方式上的有意义的差异。

尽管数据增强的好处直观易懂,但更深入的理解仍然难以捉摸。例如,是否存在一种意义,使得随着超参数的变化,数据增强方法沿着良定义的轨迹移动表征?不同的增强方法(如图像旋转和随机裁剪)是否以根本不同的方式塑造隐藏层计算,抑或它们的效果是冗余的?当同时应用两种增强方法时,它们如何相互作用?更广泛地,当模型在超参数值不同的情况下进行集成时,表征几何结构的多样性是否能预测功能改进的程度?两种增强方法能否协同地相互作用或相互干扰,并且能否从其隐藏表征几何结构中观察到这一点?

作为解决这些问题的第一步,我们利用了先前开发的关于隐藏层表征几何结构的度量空间[27 (https://arxiv.org/html/2605.15306#bib.bib25),17 (https://arxiv.org/html/2605.15306#bib.bib26)]。该框架将隐藏层表征的几何结构识别为可能几何结构平滑流形上的点,从而能够利用微分几何工具研究超参数变化对学习表征的影响。特别是,增强强度的逐渐变化可以概念化为在该流形上沿平滑路径移动表征几何结构。不同类型的增强在流形上产生不同的路径,我们可以计算这些路径的长度和曲率,以及交点处的角度。总之,这使我们能够系统地比较增强强度和类型如何跨网络层、初始化和架构重塑表征几何结构。我们的主要贡献如下:

- • 我们提出了一个几何框架,用于分析数据增强超参数对学习到的神经表征的影响。
- • 我们证明,增加数据增强幅度会将表征沿结构化轨迹引导至该*形状空间*中,但不会在朴素的欧几里得空间中。
- • 我们研究了因数据增强导致的表征形状变化幅度与因不同随机种子导致的表征变化幅度相比如何。
- • 我们表明,不同增强轨迹之间的更大差异能预测模型集成带来的更大收益。
- • 我们发现,数据增强不均匀地移动形状地标,其效应取决于网络深度和数据增强类型。

## 2 相关工作

数据增强。数据增强是现代机器学习流程中的核心技术,用于增加数据多样性、提升泛化能力并增强鲁棒性[23 (https://arxiv.org/html/2605.15306#bib.bib32),26 (https://arxiv.org/html/2605.15306#bib.bib36),2 (https://arxiv.org/html/2605.15306#bib.bib24),4 (https://arxiv.org/html/2605.15306#bib.bib29)]。通常认为,增强通过沿无关维度“坍缩”表征流形来塑造神经计算,以便同一输入的不同增强视图被映射到相似的响应[18 (https://arxiv.org/html/2605.15306#bib.bib22)]。视图不变表征的更广泛原理可以追溯到几十年前的计算机视觉和视觉神经科学文献[21 (https://arxiv.org/html/2605.15306#bib.bib19),22 (https://arxiv.org/html/2605.15306#bib.bib20),7 (https://arxiv.org/html/2605.15306#bib.bib21)]。

重要的是,用增强训练会“坍缩”增强视图到单一点这一直觉仅涉及增强数据集的表征几何结构——它并*不*告诉我们,用增强训练如何改变干净图像上的表征流形。对于产生分布外训练样本(例如,添加大量高斯噪声)的增强技术,这一区别尤为重要,其目标是提升未见过的分布内样本的性能。在本文中,我们研究不同增强如何改变测试集中非增强的“干净图像”的表征。

表征相似性。比较神经网络表征对于理解训练动态、可迁移性和模型等价性至关重要。表征相似性度量旨在表征跨层和跨模型的隐藏层激活模式之间的关系。诸如中心核对齐(CKA)之类的度量通过基于核对齐来测量激活矩阵之间的成对相似性[16 (https://arxiv.org/html/2605.15306#bib.bib30)],并广泛用于研究层表征如何随随机种子或架构变化[20 (https://arxiv.org/html/2605.15306#bib.bib5)]。最近的工作提出使用形式化的度量空间来捕捉表征中更细微的几何结构[27 (https://arxiv.org/html/2605.15306#bib.bib25)],从而允许对表征进行更高级的分析方法,如回归和聚类。[17 (https://arxiv.org/html/2605.15306#bib.bib26)]利用这一思想研究了表征在深度神经网络各层中的轨迹,并引入了黎曼几何的概念来研究这些路径。虽然我们的工作借鉴了类似的方法论思想,但我们将其应用于研究*跨模型*的神经表征轨迹,随着超参数被调整。

## 3 方法

在本节中,我们定义了神经表征的度量空间概念。然后,我们讨论该度量的测地线以及如何测量表征轨迹之间的角度。最后,我们讨论如何根据地标位移来解释空间中轨迹的方向,地标位移测量了在去除无关变换后,每个图像输入的隐藏层响应变化了多少。

参见图1注:图1:嵌入形状空间可以更有意义地比较大规模表征集成。(a) 使用不同数据增强方法端到端训练两个模型后,从测试数据集中随机选取M个未修改图像作为探针图像。使用黎曼形状距离方程 (2) 测量这两个表征之间的距离,该距离定义为经过平移、缩放、旋转和反射后的角距离。(b) 来自层ℓ的表征形状与黎曼形状距离形成一个度量空间,在该空间中,我们可以测量距离、计算测地线,并在数据增强参数变化时测量角度。

问题设置。设 f_L^A: Z → Y 表示一个具有 L∈N 层的前馈神经网络函数,其中 Z 是输入空间,Y 是输出空间,网络使用数据增强策略 A 训练。神经网络 f_L^B: Z → Y 在架构和初始化上与 f_L^A 相同,但使用数据增强策略 B 训练。

我们将从输入域到具有 N 个单元的隐藏层 ℓ 的激活向量的*表征映射*定义为 f_ℓ^A: Z → R^N,类似地 f_ℓ^B: Z → R^N。由 f_ℓ^A(·) 和 f_ℓ^B(·) 在隐藏层中产生的激活模式有多相似?更具体地说,由数据增强方法变化 A→B,或超参数幅度增加 A→A+ΔA 导致的训练数据变化,如何体现在 f_ℓ^A(·)、f_ℓ^B(·) 和 f_ℓ^{A+ΔA} 形成的表征中?我们通过一组代表性的未修改探针输入 z_1, ..., z_M∈Z(来自测试集,即干净图像)来测量这些变化。

遵循比较神经表征的既定实践(例如见[16 (https://arxiv.org/html/2605.15306#bib.bib30),27 (https://arxiv.org/html/2605.15306#bib.bib25)]),我们测量神经响应 f_ℓ^A(z_1)...f_ℓ^A(z_M) 并按行堆叠成表征矩阵 X_ℓ^A∈R^{M×N}。类似地,我们从第二个网络的响应 f_ℓ^B(z_1)...f_ℓ^B(z_M) 形成矩阵 X_ℓ^B∈R^{M×N}。直观上,这些矩阵可以被视为每个网络在离散的 M 个“地标”点上对层 ℓ 输入映射的近似。表征矩阵 X_ℓ^A 可以可视化为 N 维空间中的 M 个点(图1a)。

黎曼形状距离。测量表征 X_ℓ^A 和 X_ℓ^B 之间的距离因层 ℓ 中神经维度之间没有固有的对应关系而变得复杂。已提出了多种基于对齐或比较网络内距离的度量(参见[15 (https://arxiv.org/html/2605.15306#bib.bib4)]的综述)。在本文中,我们使用黎曼形状距离[13 (https://arxiv.org/html/2605.15306#bib.bib27)],它与密切相关的普氏距离一起,创建了一个比较深度网络表征的框架[27 (https://arxiv.org/html/2605.15306#bib.bib25),8 (https://arxiv.org/html/2605.15306#bib.bib13)]。这种距离概念认为,如果两个表征的点云(见图1a)可以通过平移、旋转、反射和缩放重叠,则它们等价。直观上,这意味着点云具有相同的几何结构,因此携带相同的线性可解码信息[10 (https://arxiv.org/html/2605.15306#bib.bib11)]。

为了计算两个表征矩阵 X_i∈R^{M×N} 和 X_j∈R^{M×N} 之间的黎曼形状距离,我们首先将神经响应中心化到原点并重新缩放到单位范数:

Z_i = (C X_i) / ||C X_i||_F  且   Z_j = (C X_j) / ||C X_j||_F   (1)

其中 C = I_M - (1/M) 1_M 1_M^T 是中心化矩阵。预处理后的矩阵 Z_i 和 Z_j 通常被称为预形状。表征 S_i 的*形状*定义为预形状的所有旋转和反射版本的集合:S_i = {Z_i O : O ∈ O(N)},其中 O(N) 是 N 维空间中旋转和反射的正交群,即满足 O^T O = O O^T = I_N 且 det O = ±1 的 N×N 矩阵的集合。*形状空间* Σ_N^M 是 R^N 中具有 M 个地标的所有形状的空间。那么,黎曼形状距离定义为:

ρ(X_i, X_j) = arccos( sup_{O∈O(N)} Tr[ Z_j^T Z_i O ] )   (2)

它可以解释为预形状超球面上 Z_j 与对齐后的表征 Z_i^* = Z_i O^* 之间的距离,其中 O^* 是实现在方程 (2) 中上确界的正交矩阵。

方程 (2) 是通过形状空间的内在测地线距离。它以弧度为单位,是预形状 Z_i 和 Z_j 在超球面上通过 N 维旋转所能实现的最小角度。

形状距离 ρ 是对称的且满足三角不等式。实际上,它是形状空间上的一个真正度量,¹¹直观上,形状是通过 N 维正交变换可实现的等价位形状集合。进一步背景见[14 (https://arxiv.org/html/2605.15306#bib.bib12),9 (https://arxiv.org/html/2605.15306#bib.bib16)]。并且它定义了形状之间的闭式测地线路径,如下所述。

相似文章

贝叶斯神经网络的等变性和数据增强

arXiv cs.LG

本文研究了使用变分推断训练的贝叶斯神经网络的数据增强方法,推导了精确等变性的条件,并引入了新颖的对称化技术(如轨道扩展)以提升对称性和性能。

数据增强:傅里叶分析视角

arXiv cs.LG

本文开发了一个傅里叶分析框架,用于研究群不变性下的数据增强,表明部分增强可以在近似误差趋近于零的情况下实现与完全增强相同的极小极大速率,同时还证明了精确不变性需要全群平均。

SAEs 能否捕捉神经几何?(6分钟阅读)

TLDR AI

本文探讨了稀疏自动编码器(SAEs)如何捕捉弯曲的神经几何,揭示了SAE特征表示流形的三种不同方式,并提出了一个无监督流程来揭示神经表征中的几何结构。