任意维度不变普适性
摘要
本文开发了一个系统框架,用于建立处理可变维度输入(例如,具有不同节点数的图)的机器学习模型的普适性。论文表明许多现有架构不具有普适性,并提出了简单的修改来恢复普适性。
arXiv:2605.23156v1 公告类型:新
摘要:一些机器学习模型被定义为适用于任意大小的输入,例如具有不同节点数的图和包含不同数量点的点云。这类任意维度模型的普适性性质仍未被充分理解,因为普适性传统上针对接受固定大小输入、定义在域中紧致子集上的模型进行研究。与此形成鲜明对比的是,任意维度模型可以被视为定义在逐渐增大输入上的函数序列,目前尚不清楚它们在何种意义上具有普适性。我们开发了一种系统方法来建立任意维度普适性,通过将任意维度函数等同于一个唯一的函数,该函数的输入位于一个合适的无限维极限空间中,该空间包含所有有限大小的输入及其极限。利用这些输入的对称性以及不同大小输入之间的关系,我们证明了这个极限空间具有一个自然拓扑,并且存在丰富的紧致集合族,在这些集合上可以建立任意维度普适性。我们通过展示几种现有架构不具有普适性,并提出了简单的修改来恢复普适性,来说明我们的方法。
查看缓存全文
缓存时间: 2026/05/25 09:01
# 任意维度不变泛化性
来源:https://arxiv.org/html/2605.23156
沈泰尧(Shengtai Yao)
应用数学与统计系,约翰霍普金斯大学,巴尔的摩,MD 21218,美国。MD 由 NSF 奖项 CCF 2442615 和 DMS 2502377 以及斯隆研究奖学金部分资助。
埃坦·莱文(Eitan Levin)
计算与数学科学系,加州理工学院,帕萨迪纳,CA 91125,美国。EL 由 AFOSR FA9550-23-1-0070 和 FA9550-23-1-0204 部分资助。
###### 摘要
多种机器学习模型可处理任意大小的输入,例如具有不同节点数的图以及包含不同数量点的点云。这类任意维度模型的泛化性仍缺乏深入理解,因为传统泛化性研究针对的是在固定紧凑定义域子集上接受固定大小输入的模型。与此形成鲜明对比的是,任意维度模型可视为定义在规模递增输入上的函数序列,因此其泛化性含义尚不明确。我们开发了一种系统方法来建立任意维度泛化性,其核心是将任意维度函数唯一映射到某个合适无限维极限空间上的函数,该空间包含所有有限大小输入及其极限。利用这些输入的对称性以及不同大小输入之间的关系,我们证明该极限空间具有自然拓扑,并包含丰富的紧集族,在这些紧集上可以建立任意维度泛化性。我们通过展示几种现有架构未能实现泛化性,并提出简单的修改来恢复泛化性,从而说明我们的方法。
## 1 引言
传统监督学习旨在通过使用位于固定有限维空间中的训练样本来学习定义在该空间上的映射。相比之下,许多现代学习任务涉及定义在可变维度输入上的映射。例如,图参数、粒子系统动力学、博弈和正则化项,无论节点、粒子、玩家或变量的数量如何,都保持有意义。文献中有多种架构被定义为可处理任意维度的输入,例如用于集合的 DeepSets [1 (https://arxiv.org/html/2605.23156#bib.bib1)]、用于图的图神经网络 (GNN) [2 (https://arxiv.org/html/2605.23156#bib.bib2)] 以及用于点云的 PointNet [3 (https://arxiv.org/html/2605.23156#bib.bib3)]。实际上,这些任意维度架构用有限个参数化了一个具有递增输入维度的无限不变函数序列 \((f_n: V_n \to \mathbb{R})_n\)。¹
尽管任意维度架构层出不穷,但其表达能力仍相对未被探索。具体来说,上述大多数任意维度架构的泛化性主要是在固定维度或有限维度中研究的 [4 (https://arxiv.org/html/2605.23156#bib.bib4), 5 (https://arxiv.org/html/2605.23156#bib.bib5), 6 (https://arxiv.org/html/2605.23156#bib.bib6)]。这引出了我们的核心问题:任意维度模型能否跨维度通用近似函数?如上所述,这个问题是病态的。要理解原因,回想经典的通用近似涉及在固定紧集 \(K\) 上用模型 \(\hat{f}\) 一致近似*单个*连续函数 \(f: K \to \mathbb{R}\)。然而,任意维度模型产生一个*序列*的具有不同定义域的映射。为了解决这个不匹配,我们采用 [7 (https://arxiv.org/html/2605.23156#bib.bib7)] 的框架。具体来说,我们将输入空间视为一个嵌套序列 \(V_1 \subseteq V_2 \subseteq \cdots\),这些是维度递增的向量空间,并将它们全部嵌入到我们构建的包含每个 \(V_n\) 作为子空间的无限维极限空间 \(V_\infty\) 中。在温和的相容性条件下,任意维度模型 \((\hat{f}_n)\) 拥有唯一的扩展 \(\hat{f}_\infty: V_\infty \to \mathbb{R}\),满足对任意 \(x \in V_n\) 和 \(n\),有 \(\hat{f}_\infty(x) = \hat{f}_n(x)\)。这种识别使得我们可以将“跨维度通用近似”视为在特定应用的无限维空间上的标准通用近似。
##### 主要贡献。我们总结以下贡献。
1. **(一个通用方法)** 我们开发了一个证明任意维度不变泛化性的一般策略。该策略强调两个原则:(i) 通过传递到轨道空间来利用对称性,即使在无限维中也能产生丰富的紧集族,从而在其上证明泛化性;(ii) 与有限维(所有范数诱导相同拓扑)不同,\(V_\infty\) 上范数的选择至关重要,因为连续性(以及可接受的激活函数和架构原语)取决于此。
2. **(实例化)** 我们将此方法应用于三个代表性领域:集合、图和点云。我们展示了几个广泛使用的架构所产生的扩展 \(\hat{f}_\infty\) 要么在学习任务诱导的自然拓扑下不连续,要么未能实现泛化性。然后我们提出修改——必要时提出新架构——以恢复连续性并达到泛化性。
##### 大纲。本节其余部分回顾相关工作。第 2 节 (https://arxiv.org/html/2605.23156#S2) 回顾了本文后续所需的任意维度学习的数学预备知识。第 3 节 (https://arxiv.org/html/2605.23156#S3) 形式化了我们希望建立的任意维度泛化性类型,并概述了建立泛化性的通用方法。第 4 节 (https://arxiv.org/html/2605.23156#S4) 将这一方法具体应用于适用于集合、图和点云的模型。最后,第 5 节 (https://arxiv.org/html/2605.23156#S5) 总结了本文的局限性和未来工作的机遇。
### 1.1 相关工作
##### 无维度学习。许多现代架构是任意维度的。卷积神经网络将相同的平移不变滤波器应用于任意分辨率的图像 [8 (https://arxiv.org/html/2605.23156#bib.bib8), 9 (https://arxiv.org/html/2605.23156#bib.bib9)]。循环神经网络和 Transformer 通过循环或注意力机制处理可变长度序列 [10 (https://arxiv.org/html/2605.23156#bib.bib10), 11 (https://arxiv.org/html/2605.23156#bib.bib11), 12 (https://arxiv.org/html/2605.23156#bib.bib12)]。诸如 DeepONet 和 FNO 的神经算子学习 (无限维) 函数空间之间的映射,并且可以在不同分辨率的网格上进行评估 [13 (https://arxiv.org/html/2605.23156#bib.bib13), 14 (https://arxiv.org/html/2605.23156#bib.bib14)]。在几何深度学习领域,已经提出了几种模型来处理任意基数的集合 [1 (https://arxiv.org/html/2605.23156#bib.bib1), 3 (https://arxiv.org/html/2605.23156#bib.bib3)]、具有不同节点和边数的图 [2 (https://arxiv.org/html/2605.23156#bib.bib2), 15 (https://arxiv.org/html/2605.23156#bib.bib15)] 以及任意大小的点云 [16 (https://arxiv.org/html/2605.23156#bib.bib16), 17 (https://arxiv.org/html/2605.23156#bib.bib17)]。最近,[18 (https://arxiv.org/html/2605.23156#bib.bib18), 19 (https://arxiv.org/html/2605.23156#bib.bib19), 20 (https://arxiv.org/html/2605.23156#bib.bib20)] 利用*表示稳定性* [21 (https://arxiv.org/html/2605.23156#bib.bib21), 22 (https://arxiv.org/html/2605.23156#bib.bib22)] 推导出通用无维度等变和不变模型类,编码了神经网络、凸集和核机器。然而,能够接受可变大小并不能保证跨大小的一致性(或可迁移)行为。可迁移性的研究起源于 GNN 文献 [23 (https://arxiv.org/html/2605.23156#bib.bib23)],此后在该背景下得到广泛探索 [24 (https://arxiv.org/html/2605.23156#bib.bib24), 25 (https://arxiv.org/html/2605.23156#bib.bib25), 26 (https://arxiv.org/html/2605.23156#bib.bib26), 27 (https://arxiv.org/html/2605.23156#bib.bib27), 28 (https://arxiv.org/html/2605.23156#bib.bib28), 29 (https://arxiv.org/html/2605.23156#bib.bib29)]。最近,[7 (https://arxiv.org/html/2605.23156#bib.bib7)] 提出了一个统一的框架——超越图的范围——来制定和认证跨维度的可迁移性。
##### 泛化性。泛化性是深度学习理论的支柱之一。让我们首先评述有限维结果。经典的通用近似定理表明,全连接网络在紧集上近似连续函数 [30 (https://arxiv.org/html/2605.23156#bib.bib30), 31 (https://arxiv.org/html/2605.23156#bib.bib31), 32 (https://arxiv.org/html/2605.23156#bib.bib32), 33 (https://arxiv.org/html/2605.23156#bib.bib33)],最近在适当的增长和激活假设下有扩展到紧域之外的结果 [34 (https://arxiv.org/html/2605.23156#bib.bib34), 35 (https://arxiv.org/html/2605.23156#bib.bib35), 36 (https://arxiv.org/html/2605.23156#bib.bib36)]。对称模型的表达能力直到最近才被研究。对于图,表达能力是微妙的:消息传递 GNN 已知具有内在局限性 [37 (https://arxiv.org/html/2605.23156#bib.bib37)],通常通过 Weisfeiler–Lehman (WL) 测试 [38 (https://arxiv.org/html/2605.23156#bib.bib38)] 形式化,许多变体已通过该视角进行分析 [37 (https://arxiv.org/html/2605.23156#bib.bib37), 39 (https://arxiv.org/html/2605.23156#bib.bib39), 40 (https://arxiv.org/html/2605.23156#bib.bib40)]。基于张量层的替代 GNN [4 (https://arxiv.org/html/2605.23156#bib.bib4), 5 (https://arxiv.org/html/2605.23156#bib.bib5)] 以及基于同态密度函数的 GNN [41 (https://arxiv.org/html/2605.23156#bib.bib41), 42 (https://arxiv.org/html/2605.23156#bib.bib42)] 确实实现了泛化性。对于置换不变问题,DeepSets 是泛化的 [1 (https://arxiv.org/html/2605.23156#bib.bib1), 43 (https://arxiv.org/html/2605.23156#bib.bib43)]。除了这些具体例子,[6 (https://arxiv.org/html/2605.23156#bib.bib6)] 建立了基于多项式不变的模型的泛化性,这些模型在任何紧群作用下对称。尽管如此,这些结果主要是在固定输入维度下表述的。相比之下,任意维度模型的泛化性仍然相对不成熟。最相关的结果是 [44 (https://arxiv.org/html/2605.23156#bib.bib44), 45 (https://arxiv.org/html/2605.23156#bib.bib45)] 用于集合,以及 [5 (https://arxiv.org/html/2605.23156#bib.bib5), 46 (https://arxiv.org/html/2605.23156#bib.bib46)] 用于图。我们的结果和策略强调了一个基于 [7 (https://arxiv.org/html/2605.23156#bib.bib7)] 中发展的可迁移性框架的更一般视角,适用于这些具体场景之外。让我们简要评论更具体的差异。首先,[45 (https://arxiv.org/html/2605.23156#bib.bib45)] 研究了某些 RKHS 类的近似下界;这些类不是我们的重点。我们的 DeepSets 结果通过覆盖更广泛的紧集类扩展了 [44 (https://arxiv.org/html/2605.23156#bib.bib44)]。在图方面,[25 (https://arxiv.org/html/2605.23156#bib.bib25)] 在简化情况下证明了图论神经网络 (graphon neural networks) 的泛化性,而 [46 (https://arxiv.org/html/2605.23156#bib.bib46)] 在 \(\delta_p\) 度量下建立了泛化性。相比之下,我们使用可以说更自然且被广泛研究的割度量 \(\delta_\square\),它诱导了更粗糙的拓扑。
## 2 预备知识
在本节中,我们介绍本文所需的符号和技术背景。
##### 符号。我们用 \(\mathbb{R}\) 和 \(\mathbb{N}\) 分别表示实数和正整数。定义 \(\mathbb{N}_0 = \mathbb{N} \cup \{0\}\) 和 \([n] \coloneqq \{1,\dots,n\}\) 对于 \(n \in \mathbb{N}\)。我们用 \(\mathrm{O}(k)\) 表示 \(k\) 维正交群,用 \(\mathrm{S}_n\) 表示 \(n\) 个字母上的对称群。对于给定的度量空间 \((\mathcal{X}, d)\),我们记以 \(x\) 为中心、\(\eta\) 为半径的开球为 \(B(x,\eta) \coloneqq \{u \in \mathcal{X} \mid d(u,x) < \eta\}\)。设 \(C(\mathcal{X}, \mathcal{Y})\) 表示从拓扑空间 \(\mathcal{X}\) 到 \(\mathcal{Y}\) 的连续映射空间,当 \(\mathcal{Y} = \mathbb{R}\) 时写作 \(C(\mathcal{X})\)。设 \(\mathcal{B}(\mathcal{X}, \mathcal{Y})\) 是赋范空间 \(\mathcal{X}\) 和 \(\mathcal{Y}\) 之间的有界线性算子空间。给定 \(\mathbb{R}^k\) 上的任意范数 \(\|\cdot\|_{\mathbb{R}^k}\),符号 \(\ell_p(\mathbb{R}^k)\) 表示满足 \(\sum_{j=1}^\infty \|X_{j:}\|_{\mathbb{R}^k}^p < \infty\) 的序列 \(X = (X_{j:} \in \mathbb{R}^k)_{j \in \mathbb{N}}\) 的空间。类似地,对于给定的测度空间 \((\mathbb{R}^m, \mu)\),令 \(L^p(\mathbb{R}^m; \mathbb{R}^k)\) 为满足 \(\|X\|_p \coloneqq \left( \int \|X(t)\|_{\mathbb{R}^k}^p d\mu(t) \right)^{1/p} < \infty\) 的可测函数 \(X: \mathbb{R}^m \to \mathbb{R}^k\) 的空间。符号 \(\|\cdot\|_p\) 酌情指代 \(\ell^p\) 或 \(L^p\) 范数。最后,设 \(\mathcal{P}(\mathbb{R}^k)\) 为 \(\mathbb{R}^k\) 上的概率测度集合,并设 \(\mathcal{P}_p(\mathbb{R}^k) \subseteq \mathcal{P}(\mathbb{R}^k)\) 表示具有有限 \(p\) 阶矩的那些测度。我们使用符号 \(W_p\) 表示 Wasserstein-\(p\) 距离。
##### 任意维度学习。接下来,我们回忆一些与任意维度模型及其跨维度泛化相关的基本概念。我们的论述遵循 [7 (https://arxiv.org/html/2605.23156#bib.bib7)];我们请感兴趣的读者参考该文献以获取更多细节。我们只关注实值函数,并相应地简化了几个定义,尽管本节中的所有概念都适用于更一般的余域。本节的关键思想是,一个具有递增大小输入的函数序列 \((f_n: V_n \to \mathbb{R})\) 可以被视为一个单一的扩展 \(f_\infty: \overline{V_\infty} \to \mathbb{R}\),定义在包含每个 \(V_n\) 作为子空间的无限维空间 \(\overline{V_\infty}\) 上。这种视角使我们能够在一个共同域上提出问题,例如泛化性,而不是跨一系列域。为了精确阐述这些想法,我们从一族编码递增大小输入的向量空间开始,同时还有连接它们的映射和关系。
###### 定义 2.1。一个 **相容序列** 是一个三元组 \(\mathbb{V} = \left\{ (V_n)_{n \in \mathbb{N}}, (\varphi_{N,n})_{n \preceq N}, (\mathrm{G}_n)_{n \in \mathbb{N}} \right\}\),其中相似文章
图神经网络随机特征的普适性与近似率
本文证明,具有随机节点特征的图神经网络可以普适地近似有向图上的置换不变或等变函数,并为可微函数提供了近似率界限。
非线性算子及其导数的通用逼近
本文证明了在无限维空间中非线性算子及其导数的首个通用逼近定理,将经典结果扩展到DeepONet和PCA-Net等算子学习架构。
统一神经缩放定律
提出了一种统一神经缩放定律,能够精确建模深度神经网络在多个维度(包括参数量、数据集大小、训练步数和计算量)上的缩放行为,并在多种架构和任务上得到验证。
通过平滑激活缓解深度神经网络一致收敛中的维数灾难
本文建立了一个理论框架,表明深度神经网络中的平滑激活可以缓解一致收敛中的维数灾难,提供非渐近保证,并在最坏情况可靠性上优于ReLU网络。
梯度下降神经网络训练的通用性
论文探讨了是否任何神经网络都可以被重新设计以通过梯度下降有效训练,并证明了一个通用性结果:对于任何网络,都存在一个扩展,可以通过梯度下降重现给定的权重和输出。