用于复数神经网络下降及其保证的Kähler景观,包括对Calabi-Yau流形的搜寻与消除
摘要
本文使用Kähler几何和信息流形探讨复数神经网络中的优化景观,为下降路径提供理论保证,并分析Calabi-Yau度量的影响。
查看缓存全文
缓存时间: 2026/08/21 10:25
# 面向复神经网络下降的凯勒景观与保证,包括卡拉比-丘流形的搜索与销毁 来源:https://arxiv.org/html/2608.19584 Andrew Gracyk 所属机构:*普渡大学数学系* *美国印第安纳州西拉法蒂 47907* [email protected] ###### 摘要 我们研究复参数化网络的景观。我们的方法受到参数的信息论流形视角以及经典优化保证的启发,尽管这些保证具有复杂的几何多样性,例如通过多布瓦渐近性。下降路径在交叉熵作用下通过似然势的维廷格海森矩阵允许一个凯勒信息度量。我们仅关注通过微分损失除以逆度量进行自然梯度下降的下降更新规则,因此下降路径保持在全纯切丛中。我们强调卡拉比-丘信息流形,它通过病态曲率条件景观破坏了理论保证。在卡拉比-丘度量下,特别是在具有全局势的非紧设置中(该势在几何上定义,而非援引卡拉比猜想的拓扑要求),一个楔形处处非零的全纯形式是凯勒形式的最高外积(直到常数),从而产生常数行列式条件。在固定行列式下,一个在特征值容差内近似低秩的度量意味着放大效应。此外,人们发现负曲率破坏了损失景观,特别是截面曲率,因此我们对此进行扩展,并建立与负定里奇曲率的相互关联。我们的论证主要存在于几何分析模态中,尽管我们通过初始化时的渐近性以及在消失和负里奇曲率下神经网络保证的失效模式,为深度学习理论建立了根基。 关键词:信息几何,复几何,凯勒流形,凯勒几何,卡拉比-丘流形,多布瓦,蒙日-安培,陈曲率,强凸性,波利亚克-洛亚塞维奇,狄利克雷能量,负曲率,里奇曲率,典则线丛,截面层,德拉姆上同调 AMS 分类 (2020):53B35, 53B12, 53Z50, 90C25 目录 ## 1 引言 我们试图为优化奠定双重基础:(1) 针对复参数神经网络68 (https://arxiv.org/html/2608.19584#bib.bib43),(2) 在信息流形41 (https://arxiv.org/html/2608.19584#bib.bib44)下。复神经网络试图解决参数化瓶颈问题,并可能实现各种水平的性能提升和对实数对应物的优势1 (https://arxiv.org/html/2608.19584#bib.bib42)。我们拥有深度学习理论的根基和相关渐近性,但我们的底层机制和策略将通过几何分析进行。损失景观通过信息流形5 (https://arxiv.org/html/2608.19584#bib.bib33) 承载几何结构,因此我们的工作受到此视角的启发。我们工作的一个主要焦点是多布瓦渐近性。10 (https://arxiv.org/html/2608.19584#bib.bib1) 建立了现代海森矩阵界限,我们在工作中从理论和经验上加强了这一点,其中海森矩阵在与谱范数和余弦相似性相关的足够好的区域空间内具有理想的渐近缩放,从而允许凸性论证发生。 现有的渐近性适用于实值神经网络,且针对的是对流形信息论结构不适用的欧几里得梯度下降方法。我们的工作通过凯勒几何分析来解决这些特性。在训练数据上的博雷尔测度对应于足够光滑的拉东-尼科迪姆导数,该导数脱离了神经网络参数依赖性的情况下,参数景观允许一个交叉熵度量,让人想起费舍尔度量(尽管由于参数不变性并不完全相同),而且由于导数与迭代积分交换,它更是势的混合维廷格导数。势,例如在二次情况下,是多重次调和的。因此,在这个势下,所允许的信息流形是凯勒的。 在进一步限制(弱)等价条件下,例如 $i^{K^2}\Omega\wedge\overline{\Omega} \sim \text{constant} \cdot \omega_K^{\wedge K} \equiv 0$ (1.1) 或消失的里奇曲率,几何在特定的凯勒类下是卡拉比-丘的。我们将尝试探讨卡拉比-丘度量在信息景观上的缺陷。我们仅通过10.4 (https://arxiv.org/html/2608.19584#S10.SS4)、10.5 (https://arxiv.org/html/2608.19584#S10.SS5) 研究这些仅在卡拉比-丘情景中受影响的情况,但也建立10.6 (https://arxiv.org/html/2608.19584#S10.SS6)、11.1 (https://arxiv.org/html/2608.19584#S11.SS1)、11.2 (https://arxiv.org/html/2608.19584#S11.SS2)、12.1 (https://arxiv.org/html/2608.19584#S12.SS1)、12.2 (https://arxiv.org/html/2608.19584#S12.SS2) 中的关联,这些部分讨论了曲率的一般作用。 在我们的分析中,里奇曲率与度量特征值(由于常数行列式条件111 这里我们使用的是凯勒版本的里奇曲率,因为它是通过对数行列式定义的,而行列式是特征值的乘积)相互联系,都减弱和放大。随着我们将看到,优化论证并非不受曲率所破坏的结构影响。缺陷并非卡拉比-丘度量独有,也可能是一般曲率的属性。在附录11.1 (https://arxiv.org/html/2608.19584#S11.SS1)、11.2 (https://arxiv.org/html/2608.19584#S11.SS2)、12.1 (https://arxiv.org/html/2608.19584#S12.SS1)、12.2 (https://arxiv.org/html/2608.19584#S12.SS2) 中,我们证明了里奇曲率本身会损害学习景观。事实上,在一些结果中,曲率影响的严重程度可能与曲率的大小成正比,因此卡拉比-丘度量只是不利效应开始出现的临界点。尽管如此,我们也在10.4 (https://arxiv.org/html/2608.19584#S10.SS4)、10.5 (https://arxiv.org/html/2608.19584#S10.SS5) 中展示了卡拉比-丘度量独有的缺陷。 ## 2 相关工作 (图注 图 1:我们绘制了沿卡拉比-丘流形下降路径对应的横截面和曲线。我们的切片对应于费马方程 $Z_1^N + Z_2^N = 1$, $N=12$。曲面通过取实部分 $(\text{Re}(Z_1), \text{Re}(Z_2))$ 投影到实平面。此图有点玩具性质,因为在下降景观场景中,流形维数要高得多。) 与更传统深度学习理论的联系。我们的工作拥有深度学习理论的根基,特别是在初始化阶段。建立神经网络导数界限(包括使用费曼图)的文献有10 (https://arxiv.org/html/2608.19584#bib.bib1)、23 (https://arxiv.org/html/2608.19584#bib.bib2)、78 (https://arxiv.org/html/2608.19584#bib.bib3)、62 (https://arxiv.org/html/2608.19584#bib.bib4)、2 (https://arxiv.org/html/2608.19584#bib.bib5)。限制海森矩阵范数也可在14 (https://arxiv.org/html/2608.19584#bib.bib14) 中找到。与深度学习理论相关以及宽度在渐近性中作用的额外工作包括32 (https://arxiv.org/html/2608.19584#bib.bib9)、7 (https://arxiv.org/html/2608.19584#bib.bib11)、13 (https://arxiv.org/html/2608.19584#bib.bib12),特别是与神经切线核31 (https://arxiv.org/html/2608.19584#bib.bib7)、36 (https://arxiv.org/html/2608.19584#bib.bib10)、45 (https://arxiv.org/html/2608.19584#bib.bib16) 相关。 我们工作的很大一部分也涉及通过几何和分析视角进行优化。来自更实分析视角的相关工作包括37 (https://arxiv.org/html/2608.19584#bib.bib45)、77 (https://arxiv.org/html/2608.19584#bib.bib47),并与瓦瑟斯坦几何17 (https://arxiv.org/html/2608.19584#bib.bib46) 相联系。专门关注(黎曼)几何分析的优化文献包括4 (https://arxiv.org/html/2608.19584#bib.bib48)、75 (https://arxiv.org/html/2608.19584#bib.bib49)、56 (https://arxiv.org/html/2608.19584#bib.bib50)、69 (https://arxiv.org/html/2608.19584#bib.bib51)、39 (https://arxiv.org/html/2608.19584#bib.bib52),因此我们的工作与这些文献高度互连。 与负截面曲率的联系。里奇曲率在优化景观中的作用已被研究27 (https://arxiv.org/html/2608.19584#bib.bib53)、46 (https://arxiv.org/html/2608.19584#bib.bib54)、6 (https://arxiv.org/html/2608.19584#bib.bib55),但这些工作大多独立于深度学习理论视角,即忽略了宽度等评论。43 (https://arxiv.org/html/2608.19584#bib.bib72) 确实研究了正里奇曲率如何积极影响收敛,因此里奇平坦和负曲率度量缺乏这一点。另一方面,15 (https://arxiv.org/html/2608.19584#bib.bib56) 表明,对于许多流形,包括哈达玛流形和双曲空间(即具有常负截面曲率),梯度下降由于曲率而经历困境。16 (https://arxiv.org/html/2608.19584#bib.bib57) 表明,主要是在双曲空间下,凸性结果由于曲率效应而经常恶化。我们的工作让人想起这些工作,而我们的工作强调里奇曲率和特征值。常数行列式意味着非常大的特征值,这在卡拉比-丘度量下的复流形中是独特的,因此我们的许多结果在转换到黎曼流形时会丢失,因为里奇曲率作为度量的对数行列式是凯勒流形独有的。我们通过检查里奇平坦情景来扩展这些工作。特别是,我们的方法在负曲率下也会经历困境,因此我们也考虑 $\text{Ric}(v,v) < 0$ (2.1),有时卡拉比-丘流形只是从较好情况到较差情况的过渡。 一般来说,在足够高的维度下,里奇平坦性是比截面曲率条件更弱的条件,因为 $\text{Ric}(X,X) = \text{Tr}_h \text{Rm}(X,\cdot,X,\cdot) = \sum_i K(X,e_i) \equiv 0 \nRightarrow K(X,Y) \equiv 0$ (2.2)。由于特征值爆炸另一方面是我们情况特有的,因此我们的卡拉比-丘结果特别经常伴随着违反 $\beta$-光滑性。 ## 3 神经网络设置 考虑训练数据 $\{z_i, y_i\}_i$, $z_i \in \mathcal{Z} \subseteq \mathbb{C}^d$, $y_i \in \mathcal{Y} \subseteq \mathbb{R}$(不失一般性,如果需要,我们可以将 $y_i$ 的虚部限制为0,因此我们保持尽可能通用的表示),其中 $y \sim p(y|x, \theta) = \mathcal{N}(f(\theta;x), \sigma^2)$ 服从数据分布。这里,$\theta \in \Theta$ 是复数值权重和偏差的总集合。考虑一个全连接复神经网络,形式为10 (https://arxiv.org/html/2608.19584#bib.bib1): $$ \alpha^{(0)}(z) = z \qquad (3.1) $$ $$ h^{(l)}(z) = \frac{1}{\sqrt{m}} W^{(l)} \alpha^{(l-1)}(z) \qquad (3.2) $$ $$ \alpha^{(l)}(z) = \phi\left(h^{(l)}(z), \overline{h^{(l)}(z)}\right), \quad l \in [L] \qquad (3.3) $$ $$ f(\theta; z, \overline{z}) = \alpha^{(L+1)}(z) = \frac{1}{\sqrt{m_L}} v^\dagger \alpha^{(L)}(z) \qquad (3.4) $$ 其中 $W$ 是在复数域 $\mathbb{C}$ 上的线性算子,$\phi: \mathbb{C} \to \mathbb{C}$ 是非全纯激活函数。这里 $\theta \in \Theta \subseteq \mathbb{C}^{\sum_k m_k m_{k+1} + m_L} := \mathbb{C}^K$。为简单起见,假设对所有 $l$,$m_l = m$。 ## 4 几何设置 ### 4.1 凯勒下降景观及其信息几何 构造概率测度使得 $y_i \sim q(y|z)$。注意 $q$ 不依赖于 $\theta$。这本身并不罕见,尽管有时 $q$ 是参数化的。我们可以指出这种形式的密度“违反了单射性”,因为 $y$ 的输出在单个 $z$ 上变化。更具体地说,$q$ 是一个马尔可夫核 $z \mapsto \mathbb{P}_{Y|Z=z}$ 26 (https://arxiv.org/html/2608.19584#bib.bib62)。 交叉熵信息度量定义为 $$ h_{i\overline{j}}(\theta) = \mathbb{E}_{z \sim p_{\text{data}}} \left[ \mathbb{E}_{y \sim q(y|z)} \left[ -\frac{\partial^2 \log p(y|z,\theta)}{\partial \theta^i \partial \overline{\theta}^j} \right] \right] \qquad (4.1) $$ 它定义了一个凯勒流形损失景观 $(M, \omega)$, $\omega \in \Omega^{1,1}(M)$,在预处理损失下,或在自然梯度下降下,其中下降更新根据逆信息度量进行缩放。在上面,$p$ 被视为损失。上述度量是凯勒的,因为维廷格导数在复数值勒贝格控制收敛下与积分交换79 (https://arxiv.org/html/2608.19584#bib.bib63),所以 $h_{i\overline{j}}(\theta) = \partial_i \partial_{\overline{j}} \Phi := \partial_i \partial_{\overline{j}} \text{potential}, \text{potential} \in \text{SPSH}(U)$ (4.2),通过取 $\Phi = \mathbb{E}_z \mathbb{E}_q [-\log p]$。 我们可以在 $L^1$ 衰减下通过控制收敛注意到维廷格导数交换: $$ \partial_{\theta^i} \partial_{\theta^{\overline{j}}} \underbrace{\int_{\mathcal{Z}} \int_{\mathcal{Y}} -\log p(y|z,\theta) q(y|z) p_{\text{data}}(z) \,dy\,dz}_{\displaystyle := \Phi} = \int_{\mathcal{Z}} \int_{\mathcal{Y}} -\partial_{\theta^i} \partial_{\theta^{\overline{j}}} \log p(y|z,\theta) q(y|z) p_{\text{data}}(z) \,dy\,dz \qquad (4.3) $$ 至关重要的是要注意我们从静态 $p$ 中移除了对 $\theta$ 的依赖。因此,上述更接近于交叉熵海森矩阵而非真正的费舍尔度量。当 $p$ 是指数似然时,负对数似然是二次的,这是 SPSH。特别是,二次代价呈现二次型 $\Phi(\theta) = \frac{1}{2} \theta^\dagger A \theta + b^\dagger \theta + \theta^\dagger c + d$。
相似文章
分叉附近的状态空间NTK坍缩
本文发展了动力模型分叉附近梯度下降的局部理论,表明状态空间神经正切核坍缩为秩一算子,主导学习动力学,使优化有效低维且可从规范形式预测。
神经网络损失景观的谱渐近:曲率指数的精确分解
本文提出了神经网络损失景观中曲率指数α的精确分解,解释了为何该指数在不同层类型间存在差异。引入了谱对齐分解,并导出了一个谱传递恒等式,连接曲率、梯度秩衰减和Hessian指数,该恒等式已在多种架构和数据集上得到验证。
基于广义Lipschitz光滑性的神经网络梯度下降收敛保证
本文针对任意宽度或深度的通用前馈神经网络,建立了梯度下降的收敛保证。文中使用了一种新颖的广义Lipschitz光滑性条件,该条件适用于常见激活函数和均方误差,且不需要特殊的初始化或数据集要求。
Energy Manifold Natural Gradient Descent:面向神经PDE求解器的黎曼优化
提出了能量流形自然梯度下降(EMNGD),一种面向神经PDE求解器的流形优化框架,该框架在参数更新时与函数空间能量曲率对齐,同时遵循参数约束。理论保证和实验结果表明,该方法提高了准确性和收敛速度。
The Field Knows: Cross-Dimensional Geometry from Navigation to Black Holes
This paper introduces a continuous metric field framework trained by a single causal contrastive loss that unifies geometric structure discovery from robot navigation to black hole emergence, demonstrating zero-shot generalization across dimensions.