数据增强:傅里叶分析视角
摘要
本文开发了一个傅里叶分析框架,用于研究群不变性下的数据增强,表明部分增强可以在近似误差趋近于零的情况下实现与完全增强相同的极小极大速率,同时还证明了精确不变性需要全群平均。
arXiv:2606.24418v1 公告类型:新
摘要:数据增强是一种简单且与模型无关的方法,用于利用学习问题中已知的不变性。给定一个作用在输入空间上的群,人们通过每个样本的变换副本扩充训练集。由于它在不修改底层学习算法的情况下利用对称性,数据增强可以广泛应用于各种学习方法。然而,这种通用性带来了计算成本:当群很大时,完整的群大小增强很快变得计算上不可行。这就提出了一个根本性问题:部分数据增强能否在泛化和样本复杂度方面实现与完全增强相同的统计优势?我们开发了一个通用框架,利用傅里叶分析和有限群的表示理论来研究这个问题。我们表明,对于一大类经典学习问题,基于随机采样群元素子集的部分数据增强,在近似误差随子集大小增加而消失的情况下,可以达到与完全增强相同的极小极大速率。我们的结果为为什么部分增强尽管只近似地强制执行对称性,却可以保留完全增强的统计优势提供了理论解释,并阐明了最近在对称性学习中提出的一个问题:是否可以通过计算可扩展的方法实现一般群不变性下的统计最优学习。此外,我们证明了一个互补的不可能结果:通过数据增强强制执行精确不变性需要对整个群进行平均,当假设空间足够表达时,任何严格子集都无法实现。这些结果共同为完全和部分数据增强以及精确和近似对称强制执行提供了统一视角。
查看缓存全文
缓存时间: 2026/06/24 07:51
# 数据增强:傅里叶分析视角 来源:https://arxiv.org/html/2606.24418 Behrooz Tahmasebi¹¹⁰Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University, Cambridge, MA 02138, USA. Emails:{behrooz_tahmasebi,mweber}@seas.harvard.edu Stefanie Jegelka²²²Technical University of Munich (CIT, MCML, MDSI) and MIT Computer Science and Artificial Intelligence Laboratory (CSAIL). Email:[email protected] ###### 摘要 数据增强是一种简单且与模型无关的方法,用于利用学习问题中已知的不变性。给定一个作用于输入空间的群,我们会用每个样本的变换副本扩充训练集。由于它在不修改底层学习算法的情况下利用对称性,数据增强可以广泛地应用于各种学习方法。然而,这种通用性带来了计算成本:当群很大时,全群规模的增强很快就会变得在计算上不可行。这引发了一个基本问题:*部分数据增强能否在泛化和样本复杂度方面达到与完全增强相同的统计优势?* 我们利用傅里叶分析和有限群表示论开发了一个通用框架来研究这个问题。我们证明,对于一大类经典学习问题,基于随机采样的群元素子集的部分数据增强可以达到与完全增强相同的极小极大速率,而近似误差会随着子集大小的增加而消失。我们的结果为以下现象提供了理论解释:尽管仅近似地强制对称性,部分增强为何仍能保留完全增强的统计优势,并阐明了最近在学习对称性中提出的一个问题(Díaz等人,2025 (https://arxiv.org/html/2606.24418#bib.bib54)):在一般群不变性下,是否可以使用计算上可扩展的方法实现统计上最优的学习。此外,我们证明了一个互补的不可能性结果:通过数据增强强制*精确*不变性需要对整个群进行平均,并且当假设空间足够有表达力时,任何严格子集都无法实现。这些结果共同为完全与部分数据增强,以及精确与近似对称性强制提供了一个统一的视角。 关键词:数据增强、不变性、对称性、样本复杂度、表示论 ###### 目录 1. 1引言 (https://arxiv.org/html/2606.24418#S1)
1. 1.1 我们的贡献 (https://arxiv.org/html/2606.24418#S1.SS1)
2. 2相关工作 (https://arxiv.org/html/2606.24418#S2)
3. 3问题陈述 (https://arxiv.org/html/2606.24418#S3)
1. 3.1 数据域、对称群与作用 (https://arxiv.org/html/2606.24418#S3.SS1)
2. 3.2 函数空间与提升的群作用 (https://arxiv.org/html/2606.24418#S3.SS2)
3. 3.3 学习任务 (https://arxiv.org/html/2606.24418#S3.SS3)
4. 3.4 数据增强 (https://arxiv.org/html/2606.24418#S3.SS4)
5. 3.5 目标与问题 (https://arxiv.org/html/2606.24418#S3.SS5)
6. 3.6 投影估计器 (https://arxiv.org/html/2606.24418#S3.SS6)
4. 4主要结果 (https://arxiv.org/html/2606.24418#S4)
5. 5解释部分增强的机制 (https://arxiv.org/html/2606.24418#S5)
1. 5.1 推广到二分类 (https://arxiv.org/html/2606.24418#S5.SS1)
6. 6球面上的投影估计器 (https://arxiv.org/html/2606.24418#S6)
7. 7结论 (https://arxiv.org/html/2606.24418#S7)
8. 参考文献 (https://arxiv.org/html/2606.24418#bib)
9. A预备知识 (https://arxiv.org/html/2606.24418#A1)
1. A.1 球谐函数 (https://arxiv.org/html/2606.24418#A1.SS1)
2. A.2 Gegenbauer多项式、带状核与投影核 (https://arxiv.org/html/2606.24418#A1.SS2)
3. A.3 群 (https://arxiv.org/html/2606.24418#A1.SS3)
4. A.4 群作用 (https://arxiv.org/html/2606.24418#A1.SS4)
5. A.5 群表示 (https://arxiv.org/html/2606.24418#A1.SS5)
6. A.6 投影估计器 (https://arxiv.org/html/2606.24418#A1.SS6)
7. A.7 球面上的投影估计器 (https://arxiv.org/html/2606.24418#A1.SS7)
8. A.8 通过随机群平均实现的近似投影 (https://arxiv.org/html/2606.24418#A1.SS8)
9. A.9 部分数据增强的一致界 (https://arxiv.org/html/2606.24418#A1.SS9)
10. A.10 投影估计器的基线超额风险(无增强) (https://arxiv.org/html/2606.24418#A1.SS10)
10. B定理4.1的证明 (https://arxiv.org/html/2606.24418#A2)
11. C定理4.3的证明 (https://arxiv.org/html/2606.24418#A3)
12. D定理4.5的证明 (https://arxiv.org/html/2606.24418#A4)
13. E推广到普通最小二乘法(OLS)和无限维假设类 (https://arxiv.org/html/2606.24418#A5)
1. E.1 投影估计器与普通最小二乘法(OLS)的比较 (https://arxiv.org/html/2606.24418#A5.SS1)
2. E.2 无限维假设类 (https://arxiv.org/html/2606.24418#A5.SS2)
## 1引言 机器学习中应用最广泛且模型无关的结构利用技术之一是*数据增强*。在数据增强中,训练数据集会依据任务中已知的结构,用每个样本的变换副本进行扩充。在具有不变性的学习问题中,这种结构通常由作用于数据域的对称群来描述,而使用群变换进行增强是为了鼓励不变性并改善对未见数据的泛化能力。由于其简单性和广泛的适用性,数据增强已成为许多领域中的标准工具,包括物理学、材料科学、分子与药物发现、计算机视觉和图像处理。与通过模型架构强制不变性的方法不同,数据增强在不修改底层学习算法的情况下利用对称性。 尽管有这些优势,当底层不变性群很大时,完全数据增强很快就会在计算上变得不可行。这种情况在实践中经常出现:例如,置换群和符号翻转群的大小随数据维度呈指数增长,使得*完全*群规模的增强成本过高。在这些情况下,从业者通常采用*部分*数据增强,即仅使用群元素的一个子集,通常通过启发式方式选择。然而,关于部分增强何时以及为何成功,以及它是否能匹配完全增强的统计优势,理论理解仍然有限。 在本文中,我们通过提出以下问题来启动对这一问题的严格研究:*使用明显更小的群子集进行部分数据增强,能否实现与完全群增强相当的统计性能?* 我们在密度估计和回归的经典设置中,使用有限维投影估计器来回答这个问题。有点令人惊讶的是,我们证明,即使是非常小的随机采样子集,也足以一致地恢复数据增强的全部统计优势,尽管仅仅近似地强制对称性。我们的分析利用了群上的傅里叶分析和表示论工具,为部分数据增强的经验成功提供了原则性解释。 ### 1.1 我们的贡献 我们总结了本文的主要贡献。 #### 部分数据增强的统计最优性。 在定理4.1 (https://arxiv.org/html/2606.24418#S4.Thmtheorem1)中,我们分析了基于投影的密度和回归估计器的部分数据增强。我们证明,使用随机采样子集S ⊆ G进行部分增强,可以达到与完全群规模增强相同的极小极大最优样本复杂度,前提是采样的群元素数量满足 |S| ≳ r / r_inv,其中r表示完整特征空间的维度,r_inv是由对称性诱导的不变子空间的维度。实际上,所需的增强子集大小仅取决于不变维度r_inv,并且与群大小无关。因此,无需对整个群(可能很大甚至无限)进行平均即可实现统计最优速率。这阐明了近期工作(Díaz等人,2025 (https://arxiv.org/html/2606.24418#bib.bib54))中提出的一个问题:在一般对称群下的学习中,统计最优性能否与计算可扩展性相协调。 #### 统一且可重复使用的部分数据增强。 在定理4.2 (https://arxiv.org/html/2606.24418#S4.Thmtheorem2)和定理4.3 (https://arxiv.org/html/2606.24418#S4.Thmtheorem3)中,我们进一步从一致泛化的角度研究了部分数据增强的作用。具体来说,我们探究是否一个*单一*随机选择的增强集S可以跨多个学习任务重复使用,并且仍能以高概率达到极小极大最优速率。我们的主要发现是,在整个函数类F上强制一致性只带来了轻微的对数开销。具体地,定理4.3 (https://arxiv.org/html/2606.24418#S4.Thmtheorem3)表明,只要选择 |S| ≳ r log(min{r,|G|}) / r_inv,其中 r = dim(F),r_inv = dim(F^G)。因此,重复使用单个部分增强集的代价只是一个log(min{r,|G|})因子,即使函数空间维度r很大或群G是无限的,该因子仍然很小。 #### 通过部分增强实现精确不变性的不可能性。 最后,在定理4.5 (https://arxiv.org/html/2606.24418#S4.Thmtheorem5)中,我们建立了一个不可能性结果,突显了数据增强的一个基本计算限制。虽然部分数据增强足以实现统计最优性,但我们证明,强制对群G的*精确*不变性通常是计算上不可行的。具体来说,假设假设空间足够丰富以表示所有不可约对称模式,则通过数据增强实现精确的G不变性需要对整个群进行平均,因此任何严格子集S ⊊ G都不足够。综合起来,我们的结果揭示了部分与完全数据增强之间的明显区别:*在大对称群的小子集上进行的部分数据增强足以获得对称性的全部统计优势,而当增强仅限于群的严格子集时,无法保证精确不变性。* ## 2相关工作 #### 几何机器学习与对称性。 几何机器学习已发展成为一个强大的框架,用于将对称性和结构纳入学习算法,其应用涵盖量子系统、原子建模、连续介质力学等领域(Zhang等人,2025 (https://arxiv.org/html/2606.24418#bib.bib3);Batzner等人,2022 (https://arxiv.org/html/2606.24418#bib.bib35);Bronstein等人,2017 (https://arxiv.org/html/2606.24418#bib.bib36);Smidt,2021 (https://arxiv.org/html/2606.24418#bib.bib37);Batzner等人,2023 (https://arxiv.org/html/2606.24418#bib.bib52);Weber,2025 (https://arxiv.org/html/2606.24418#bib.bib55))。从理论角度来看,利用对称性的统计优势已针对群平均(Tahmasebi和Jegelka,2023 (https://arxiv.org/html/2606.24418#bib.bib4);Tahmasebi和Weber,2026a (https://arxiv.org/html/2606.24418#bib.bib58))以及基于规范化的方法(Tahmasebi和Jegelka,2025a (https://arxiv.org/html/2606.24418#bib.bib5))进行了研究。相关工作还考察了对称模型中正则化的作用(Tahmasebi和Jegelka,2025b (https://arxiv.org/html/2606.24418#bib.bib22))以及测试和识别不变性的问题(Dehmamy等人,2021 (https://arxiv.org/html/2606.24418#bib.bib61);Soleymani等人,2025b (https://arxiv.org/html/2606.24418#bib.bib31);Tahmasebi和Weber,2026b (https://arxiv.org/html/2606.24418#bib.bib60))。与此同时,近期研究还探讨了在不变性下学习的泛化能力(Bietti等人,2021 (https://arxiv.org/html/2606.24418#bib.bib59);Mei等人,2021 (https://arxiv.org/html/2606.24418#bib.bib13))和计算复杂度(Soleymani等人,2025c (https://arxiv.org/html/2606.24418#bib.bib32), a (https://arxiv.org/html/2606.24418#bib.bib30);Kiani等人,2024 (https://arxiv.org/html/2606.24418#bib.bib56)),强调了补充统计考虑的算法障碍。等变学习架构的逼近理论保证也已得到发展(Petrache和Trivedi,2023 (https://arxiv.org/html/2606.24418#bib.bib14);Pacini等人,2025 (https://arxiv.org/html/2606.24418#bib.bib57))。 #### 数据增强的替代方案。 虽然数据增强是强制对称性的广泛使用机制,但也有一些工作提出了将不变性直接编码到学习算法中的替代策略。规范化方法(Kaba等人,2023 (https://arxiv.org/html/2606.24418#bib.bib1);Ma等人,2024 (https://arxiv.org/html/2606.24418#bib.bib2);Dym等人,2024 (https://arxiv.org/html/2606.24418#bib.bib38);Shumaylov等人,2025 (https://arxiv.org/html/2606.24418#bib.bib51))旨在将输入映射到其轨道的规范代表,而帧平均(Puny等人,2022 (https://arxiv.org/html/2606.24418#bib.bib7))提供了一种基于结构化特征表示平均的相关方法。这些方法避免了显式的数据增强,但通常需要仔细的设计或额外的计算假设。 #### 数据增强的理论视角。 与等变和不变模型的广泛文献相比,数据增强本身的理论理解仍然相对有限。现有工作从多个角度研究了数据增强,包括其对神经网络训练动态的影响(Shen等人,2022 (https://arxiv.org/html/2606.24418#bib.bib17))、作为隐式正则化形式的作用(Lin等人,2024 (https://arxiv.org/html/2606.24418#bib.bib18);Yang等人,2023b (https://arxiv.org/html/2606.24418#bib.bib29))及其群论基础(Chen等人,2020 (https://arxiv.org/html/2606.24418#bib.bib19))。与我们设置最相关的是,Dao等人(2019 (https://arxiv.org/html/2606.24418#bib.bib8))开发了一种基于核的数据增强分析,并在(Patil和Du,2023 (https://arxiv.org/html/2606.24418#bib.bib21);Mei等人,2021 (https://arxiv.org/html/2606.24418#bib.bib13))中进行了进一步的改进和推广。然而,这些工作并未解决*部分*增强是否能恢复对称性的全部统计优势的问题。 #### 自适应和任务驱动的增强。 除了被动增强方案外,近期一些工作还探索了生成式、主动式或自适应数据增强策略(Zheng等人,2023 (https://arxiv.org/html/2606.24418#bib.bib24);Dong等人,2023 (https://arxiv.org/html/2606.24418#bib.bib25);Chen等人,2024 (https://arxiv.org/html/2606.24418#bib.bib26))。这些方法旨在基于数据或学习目标优化增强策略,但它们在很大程度上与本文研究的问题正交。为了更广泛的视角,可参阅深度学习中的图像增强综述(Shorten和Khoshgoftaar,2019 (https://arxiv.org/html/2606.24418#bib.bib49))。相似文章
贝叶斯神经网络的等变性和数据增强
本文研究了使用变分推断训练的贝叶斯神经网络的数据增强方法,推导了精确等变性的条件,并引入了新颖的对称化技术(如轨道扩展)以提升对称性和性能。
数据增强如何塑造神经表征
本文利用形状分析工具,刻画了不同数据增强策略如何重塑神经网络表征的几何结构,发现增强强度和类型会在形状空间中产生截然不同且具有良好规律的轨迹。
群不变谱嵌入
本文提出将对称性融入谱嵌入的亲和核中,证明了在商流形上不变图拉普拉斯算子的收敛性,并改善了样本复杂度。
揭秘数据受限语言模型预训练中的训练时数据增强
本文研究了在数据受限、算力充足的场景下,为缓解自回归语言模型预训练中的过拟合而采用训练时数据增强技术,发现结合词元级噪声、序列排列和目标偏移预测可以改善验证损失。
群代数张量:可证明最优的等变学习与物理对称性发现
本文介绍了 ⋆_G 张量代数,该框架将等变性视为内在的代数性质而非架构约束,提供了可证明最优的保对称张量逼近、用于组合多种对称性的克罗内克分解,以及 Lean 4 形式化验证。在 QM9 分子几何上的实验展示了数据驱动的物理对称性选择规则发现。