无流形的对称性:轨道上的内蕴维数
摘要
本文展示了当数据形成群轨道时,标准神经缩放定律的推导会失败,因为内蕴维数未定义,导致模型性能呈现指数缩放而非幂律缩放。
arXiv:2609.17926v1 公告类型:新
摘要:标准几何推导神经缩放指数时,以数据流形的内蕴维数作为输入。在$\mathbb{Z}_p$上的模加法中,该推导没有输入。精确的代数解是$\mathbb{Z}_p$通过等距作用的轨道。仅传递性就使得标准维数估计量的基础比率统计量成为点质量,因此估计量未定义,并且这里两个最近邻距离完全重合。在尺度$\epsilon$处打破对称性会返回一个数值,但该数值追踪$1/\epsilon$而没有无尺度平台。我们证明这种失败是普遍的,因为在任何有限群通过等距作用的轨道上,估计量报告的是集合被探测的分辨率,而非维数。替代幂律的是隐藏宽度上的指数函数,$L(h)=L_\infty+A\exp(-c\,h^{\alpha})$,$R^2$在0.982到0.995之间,而幂律在相同协议下拟合并接受相同基准时的$R^2$在0.857到0.906之间。当数据供应充足时,速率属于正则化器而非群,因为权重衰减使$c$移动47倍,而群阶仅移动1.10倍,对于每个固定的$\alpha$在0.75到2之间,残差低于种子间分辨率。临界宽度随群阶下降而非上升,这与容量计数相悖,后者为每个不可约表示分配固定数量的神经元。
查看缓存全文
缓存时间: 2026/09/17 09:03
# 无流形上的对称性:轨道上的内在维度 来源:https://arxiv.org/html/2609.17926 Chon-Fai Kam†† 通讯作者,邮箱:[[email protected]](mailto:[email protected]) 所属机构:意大利巴勒莫大学物理与化学系,Archirafi路36号,I-90123 巴勒莫;法国巴黎大学及留尼旺大学,BIGR,INSERM UMR_S1134,F-75014 巴黎;法国留尼旺大学EnergyLab,F-97715 圣但尼;法国巴黎大学及留尼旺大学,BIGR,INSERM UMR_S1134,F-75014 巴黎;法国PEACCEL,生物制品AI,F-75013 巴黎 Frédéric Cadet 邮箱:[[email protected]](mailto:[email protected]) 所属机构:同上 ###### 摘要 神经缩放指数的标准几何推导将数据流形的内在维度作为其输入。在 \(\mathbb{Z}_p\) 上的模加法任务中,该推导没有输入。精确的代数解是 \(\mathbb{Z}_p\) 通过等距作用生成的轨道。仅凭传递性,标准维度估计量所依赖的比率统计量就成为一个点质量,因此估计量未定义,且两个最近邻距离恰好相等。在尺度 \(\epsilon\) 下打破对称性会得到一个数值,但该数值随 \(1/\epsilon\) 变化,没有无尺度平台。我们证明这种失败是普遍的,因为在任何有限群通过等距作用生成的轨道上,估计量报告的是探测集合的分辨率,而非维度。替代幂律的是关于隐藏宽度 \(h\) 的指数形式:\(L(h) = L_{\infty} + A \exp(-c h^{\alpha})\),其 \(R^2\) 在 0.982 到 0.995 之间,而接受相同损失下限并在相同协议下拟合的幂律的 \(R^2\) 为 0.857 到 0.906。在数据充足的情况下,衰减速率与正则化项相关而非与群相关,因为权重衰减使 \(c\) 变化 47 倍,而群阶仅使其变化 1.10 倍,该残差低于种子间分辨率,且对每个固定的 \(\alpha\)(在 0.75 到 2 之间)均成立。临界宽度随群阶增加而减小,这与容量计数论矛盾——容量计数论为每个不可约表示分配固定数量的神经元。 †† 会议记录:预印本。NeurReps 2026 审稿中 ###### 关键词 表示几何、神经缩放定律、群表示、模运算、内在维度、涌现、权重衰减 ## 1 引言 幂律是对系统的强力断言。它声称没有特定尺度被偏好,相同的相对投入在任何规模下都能带来相同的相对改进。神经缩放定律在模型规模七个数量级以及不同架构、模态和语言中均呈现为幂律(Kaplan 等,2020;Hoffmann 等,2022;Bahri 等,2024),而解释其形式为何为幂律的推导均基于对数据的一个假设。本文报告了一个任务,在该任务中,该假设在最强意义上失败:标准推导作为输入的量根本不存在。这种失败是结构性的而非数值性的,且不局限于该任务,因为导致失败的对象是一个群轨道。凡是一个表示是有限群通过等距作用生成的轨道,双最近邻估计量就会退化,且在扰动下报告的任何维度都是探测尺度的属性,而非集合的属性。条件是有限性而非对称性。连续环吸引子或环面群体编码(Gardner 等,2022)不在讨论范围内,而对连续环面进行相同处理会返回接近 2 的稳定值。被涵盖的情况是采样情形,即常见的实验情形:在 \(N\) 个等距刺激条件下记录的群体本身就是一个有限轨道,从其估计的内在维度报告的是探测尺度而非底层吸引子的几何。 两种推导占主导地位。第一种将指数与几何联系起来,从单元大小与维度流形的关系推导出 \(L \sim N^{-4/d}\)(Sharma 和 Kaplan,2022)。第二种通过计数推导:如果一个任务分解为子任务,其使用频率遵循 Zipf 分布,且每个学习的子任务固定地减少损失,则累积损失也是幂律(Michaud 等,2023;Brill,2024)。这两种解释除了产生指数的成分外几乎完全不同,而该成分在两种情况下都是数据结构上的无尺度分布。代数任务不提供这两种成分,文献已注意到问题。这些任务通过涌现进入该领域(Power 等,2022;Liu 等,2023;Varma 等,2023),算法问题上的损失曲线显示出明显的相变,偏离了已确立的幂律趋势(Naidu 等,2026)。在一个一维回归问题上,几何关系被直接矛盾,测量得到的指数为 1,而预测值为 4(Liu 和 Tegmark,2023)。尚未被问及的是当幂律失效时什么取代它,以及几何推导所需的量是否根本存在。对于模加法,它不存在,原因可在任何测量前陈述:精确解是闭合形式已知的(Nanda 等,2023;Gromov,2023;Chughtai 等,2023),其图像是 \(\mathbb{Z}_p\) 通过等距作用生成的轨道,而非来自密度的样本。主要假设是衰减速率可分解为 \(\log c = f(\lambda) + g(p)\),且 \(g\) 为常数,因此正则化预算而非群阶决定了速率。第 2.4 节的设计使得两次扫描可以不同。架构的选择使这种分离可读,因为具有二次激活的两层网络允许精确解,其傅里叶分量逐项已知(Gromov,2023;Doshi 等,2024)。我们贡献如下:内在维度在群轨道表示上是未定义的,而非仅仅被错误测量:在有限群通过等距作用的任何轨道上,双最近邻比率统计量是点质量(命题 1),对于所讨论的表示恰好等于 1(引理 6),且在尺度 \(\epsilon\) 扰动下,估计量随 \(1/\epsilon\) 变化而没有平台。\(\mathbb{Z}_p\) 上的测试损失随隐藏宽度呈指数变化,而非参数数量的多项式变化,跨越四个半数量级,接受相同损失下限并在相同协议下拟合的幂律在每个群阶和每个固定指数(0.75 到 2 之间)均被拒绝。在数据充足的情况下,速率可分解:权重衰减使其变化 47 倍,群阶仅使其变化 1.10 倍(低于种子间分辨率),在该范围内的每个固定指数下均成立。泛化出现的宽度随群增长而减小,这与容量论在符号和大小上矛盾——容量论为每个不可约表示分配固定数量的神经元。在该任务上,几何路径没有输入,幂律被随隐藏宽度的指数取代,且该指数的速率属于训练阶段而非群。 ## 2 问题表述 ### 2.1 任务与模型 任务是素数 \(p\) 下循环群 \(\mathbb{Z}_p\) 中的加法。输入是二元组 \((a,b) \in \mathbb{Z}_p \times \mathbb{Z}_p\),编码为两个拼接的独热向量,因此输入维度为 \(2p\),目标是 \((a+b) \bmod p\),视为 \(p\) 分类问题。\(p^2\) 个二元组中一半被保留,划分从固定种子中抽取一次,因此在所有宽度、权重衰减和初始化中相同。表 1 收集了符号。网络遵循 Gromov (2023)。记输入为 \(x\), \[ f(x) = W_2 \, \sigma\!\left(W_1 x\right), \qquad \sigma(z) = z^2, \tag{1} \] 其中 \(W_1 \in \mathbb{R}^{h \times 2p}\),\(W_2 \in \mathbb{R}^{p \times h}\),无偏置。二次激活使解的傅里叶分量以闭合形式呈现,因为余弦和的平方中的频率 \(k\) 交叉项直接产生 \(\cos \omega_k (a+b)\)。参数数量为 \(N = 3ph\),因此在固定 \(p\) 下宽度与参数数量成比例。训练使用全批量 AdamW(Loshchilov 和 Hutter,2019),权重衰减作为主要控制变量,在 \(\{0, 0.1, 0.25, 0.5, 1, 2, 4\}\) 上扫描,在需要单一值时默认为 1。每个点运行三个种子。报告的量是保留集上的交叉熵和准确率,以及第 2.3 节的两个谱量。附录 E 给出了优化器设置、初始化和步数预算。 ### 2.2 作为群轨道的精确解 本文测量的几何在任何网络训练前由表示理论固定。记 \(\omega_k = 2\pi k / p\),\(\mathbb{Z}_p\) 的实不可约表示包括平凡表示和 \(K_{\mathrm{max}} = (p-1)/2\) 个二维表示,其中 \(\rho_k(m)\) 是旋转 \(\omega_k m\),且 \(k\) 和 \(p-k\) 等价。*频率*和*不可约表示*因此是同一对象的两种计数方式,群阶 \(p\) 下可用的数量为 \(K_{\mathrm{max}}\)。对于非空 \(S \subseteq \{1,\dots,K_{\mathrm{max}}\}\),定义嵌入 \[ \Phi_S: \mathbb{Z}_p \to \mathbb{R}^{2|S|}, \qquad \Phi_S(n) = \big(\cos \omega_k n,\ \sin \omega_k n\big)_{k \in S}, \tag{2} \] 并记 \(X_S = \Phi_S(\mathbb{Z}_p)\) 为其像。任务的精确代数解(闭合形式已知)将 \(p\) 个输入令牌放置在某个 \(S\) 的 \(X_S\) 点上。群通过 \[ m \cdot \Phi_S(n) = \Phi_S(n+m) = \Big(\bigoplus_{k \in S} \rho_k(m)\Big) \, \Phi_S(n), \tag{3} \] 作用于 \(X_S\),这在旋转下是分块对角的,因此是环境空间的等距。该作用是传递的,且由于 \(p\) 为素数且 \(S\) 非空,它是自由的,因此 \(\Phi_S\) 是单射且 \(|X_S| = p\)。研究对象因此是有限群通过等距作用生成的单一轨道,而非流形上密度的样本,第 4 节表明这正是破坏几何推导的原因。 ### 2.3 候选控制变量 文献提出了三种决定此类任务性能的量,本研究在问题规模上测量所有三种。第一种是内在维度 \(d\),几何推导将其作为输入,使用 Facco 等 (2017) 的双最近邻方法在 \(X_S\) 或训练网络学习的嵌入上估计。第二种是网络承载的不可约表示数量,通过 \(W_1\) 嵌入块的谱功率的聚合参与比 \(K_{\mathrm{eff}}\) 测量,并通过在单个隐藏单元内相同构造的每神经元比率测量,两者均定义于附录 C(公式 34)。第三种是保留准确率首次超过 0.9 的宽度 \(h_c\),容量论会在此定位对群阶的依赖。 ### 2.4 假设 关于此任务性能限制的竞争解释做出相反预测,设计选择使它们可以不同。在*容量*解释下,约束是网络能承载的不可约表示数量,因此损失随宽度下降的速率以及泛化出现的宽度 \(h_c\) 都应随 \(K_{\mathrm{max}}\)(从而随 \(p\)) 缩放。在*预算*解释下,约束不是模式的可用性,而是它们表达的范数,因此速率应仅是正则化强度 \(\lambda\) 的函数。记该速率为 \(c\),预算解释预测分解 \[ \log c = f(\lambda) + g(p), \qquad g\ \text{在}\ p\ \text{下为常数}, \tag{4} \] 该预测被 \(g\) 对群阶的任何可分辨依赖所证伪。在固定数据下扫描宽度分离容量与优化,在固定宽度下扫描权重衰减分离范数预算与容量。我们测量八个群阶(从 23 到 113)的测试损失,跨越十四个宽度(从 8 到 128)和七个权重衰减强度,每个点三个种子。三个问题组织下文:\(X_S\) 上是否存在 \(d\)(第 4 节),哪种函数族描述 \(L(h)\)(第 3 节),以及哪种扫描移动速率(第 6 节)。 图 1:权重衰减为 1 时测试损失随宽度变化,拟合公式 (5)(\(\alpha=1\))(a),以及拟合的下限随可用频率数量的变化(b)。超过 \(K_{\mathrm{max}}=26\) 后,下限跌入附录 E 中记录的平台噪声,此处的平坦化未被拟合。 ## 3 损失随宽度呈指数变化 第一个问题是常用函数形式是否描述数据。将 \(\log L\) 与 \(\log N\) 在所有 112 个配置上池化拟合(权重衰减 1),得到 \(R^2 = 0.726\),而将 \(\log L\) 与 \(h\) 拟合得到 \(R^2 = 0.924\),每个群阶下最佳幂律的 \(R^2\) 在 0.857 到 0.906 之间。残差不是分散而是弧形,在每个八个群阶上给出 Wald–Wolfowitz 游程统计量 \(z = -2.78\)(附录 E)。
相似文章
权重空间感知差距中有多少实际上是基于对称性的?基于约1.8百万拟合SIRENs的证据 [R]
本文研究了参数对称性在权重空间感知中的作用,表明仅对称性散布就能解释共享初始化和独立拟合神经网络之间性能下降的几乎全部。该研究使用SIRENs和大规模实验论证,计算优势可能证明权重空间方法优于函数访问的信息等价性。
基于神经网络权重的可观测性与位置编码相关的对称性读出
本文指出,从神经网络权重中可见的几何对称性取决于位置编码和读出可观测量,并通过在多个对称群下训练二维符号距离函数的MLP进行了验证。
[R] 测量对称性--数据交换速率
本文实证测量了等变性理论预测的对称性与数据交换速率,发现错误群对称约束具有实际危害,测试时轨道平均的数据增强与等变架构相匹配,而理论上 |G| 倍的样本复杂度降低仅得到弱证实,且置信区间较宽。该研究明确为探索性,未预先注册。
Statistically Meaningful Geometry 与规范对称破缺:科学发现与智能涌现的几何基础
本文介绍了 Statistically Meaningful Geometry (SMG),这是一个几何框架,用于将过参数化学习系统建模为无限维非参数 Orlicz 纤维丛。它提出在分布外刺激下,系统会发生规范对称破缺,导致新的因果轴涌现,从而能够区分真正的科学发现与幻觉。
群不变谱嵌入
本文提出将对称性融入谱嵌入的亲和核中,证明了在商流形上不变图拉普拉斯算子的收敛性,并改善了样本复杂度。