利用张量特征训练网络加速高维函数学习
摘要
本文提出一种加速高维函数深度神经网络训练的方法,通过引入上下文特征(包括来自分解预训练DNN的秩1特征和张量特征),并利用随机张量分解将存储成本降低数个数量级。
arXiv:2608.10351v1 公告类型:新
摘要:在这项工作中,我们提出了一种使用深度神经网络(DNN)加速高维函数学习优化的方法。该优化过程将上下文特征引入DNN的第一层。DNN的参数通过标准梯度下降进行优化,同时保持输入特征基固定。在DNN参数优化之后,特征层有机会在DNN优化恢复之前进行更新和改变。特征层有两类函数:一类可以在域上以无矩阵方式快速求值(即秩1特征),另一类则更复杂,必须首先使用张量网络(TN)分解策略进行分解(张量特征)。特别地,我们研究了添加特征的效果,这些特征通过离散化和分解策略将预训练的DNN提炼为TN。为了高效分解由离散化DNN构建的高维函数,我们利用了随机张量分解策略。通过随机化,我们能够将高维函数分解的存储成本降低至少8个数量级。使用这种方法,我们能够高效地训练5到40维的模型。
查看缓存全文
缓存时间: 2026/08/12 08:28
# 基于张量特征训练网络的高维函数加速学习
Yuehaw Khoo*, Haizhao Yang†
*University of Maryland, College Park, College Park MD 20742 USA
†University of Chicago, Chicago, IL 60637 USA
###### 摘要
本文提出了一种利用深度神经网络 \(DNN\) 加速高维函数学习优化的方法。该优化过程将上下文特征引入 DNN 的第一层。在保持输入特征基固定的同时,通过标准梯度下降优化 DNN 的参数。DNN 参数优化结束后,特征层会在 DNN 优化恢复之前获得更新和改变的机会。特征层包含两类函数:一类可以在域上以无矩阵方式快速求值(即秩 1 特征),另一类是必须首先使用张量网络 \(TN\) 分解策略进行分解的较复杂特征(张量特征)。特别地,我们研究了添加通过“离散化与分解”策略将预训练 DNN 提取为 TN 的特征所产生的效果。为了高效分解由离散化 DNN 构造的高维函数,我们利用了随机化张量分解策略。通过随机化,我们能够将高维函数分解的存储成本降低至少 8 个数量级。利用该方法,我们能够高效训练 5 到 40 维的模型。
## I 引言
在科学计算中,对连续函数进行插值并求解偏微分方程 \(PDEs\) 的方法是一项有趣且持续存在的挑战。表示连续函数的经典方法需要用户构建非平凡的网格,或引入复杂的数值技术。这些策略不仅从实现角度看非常复杂,而且可能需要大量的计算资源。尤其是基于网格的策略会受到维数灾难的影响,即多维数组元素的存储和访问成本随数组维数呈指数增长。为了打破维数灾难并求解大规模高维问题,科学机器学习 \(ML\) 近年来应运而生。[12](https://arxiv.org/html/2608.10351#bib.bib1), [18](https://arxiv.org/html/2608.10351#bib.bib2)
科学 ML 是一套强大的工具,可用于紧凑地表示高维未知函数。这些工具通过使用可调参数的非线性网络来学习函数的底层结构。由于科学 ML 模型不试图记忆网格上特定点处的函数值,因此这些模型通常被称为无网格方法。从构造上看,这些模型具有极强的表达力,且模型中可优化组件的数量与函数维数没有强相关性。尽管科学 ML 模型在表示各种函数方面表现出色,但 ML 模型的优化可能是一个极其低效的过程,即使在当今高吞吐量的 GPU 处理单元上也可能需要数百个计算小时。对于深度神经网络 \(DNN\) 优化,如物理信息神经网络 \(PINNs\),尤其如此,因为其优化是非凸的。[8](https://arxiv.org/html/2608.10351#bib.bib3), [23](https://arxiv.org/html/2608.10351#bib.bib4) 一般来说,随着函数维数增加,训练 ML 模型变得更加困难且收敛缓慢。已有许多加速优化过程的想法,例如在训练过程中针对高残差子域的采样技术[5](https://arxiv.org/html/2608.10351#bib.bib6),以及利用核方法构造随机特征的方法。[15](https://arxiv.org/html/2608.10351#bib.bib7)
在本工作中,我们有兴趣利用张量网络 \(TN\) 方法的思想来提高 DNN 训练的效率。TN 作为高效表示高维函数和数据的方法,在科学计算中越来越受欢迎。[20](https://arxiv.org/html/2608.10351#bib.bib5) 实际上,张量网络方法试图将高维函数分解为低维分量函数外积的和。利用这种分解技术,张量网络方法能够打破维数灾难。与无网格 ML 模型不同,TN 方法确实需要配点网格。因此,虽然该方法的确切存储复杂度取决于 TN 的拓扑结构,但一般来说,存储 TN 的成本与被分解函数的维数以及每个维度的配点数量之间存在很强的相关性。TN 表示函数的能力具体取决于函数类型和 TN 的拓扑结构。尽管这些特性使 TN 在一般情况下比 ML 模型更难应用于问题,但 TN 方法在高效优化方面确实表现出色。这是因为大多数张量网络算法依赖于奇异值分解等线性代数技术,而机器学习模型则依赖于非凸梯度下降技术。因此,在本工作中,我们试图确定如何利用 TN 方法的优势属性(即可靠的优化性和可解释性)来改进和加速 DNN 的优化。
我们的想法类似于冷启动初始化技术,其工作方式如下:我们生成一组函数,并将这些函数应用于 DNN 的输入数据。我们将这些函数的输出添加到 DNN 的输入层,并在输入数据和新特征的约束下优化 DNN 的参数。最直接的特征是先前优化好的 DNN。我们在本工作中证明了该想法为何失败,并转而使用 TN 分解策略来改进这一想法。此外,我们识别了两类不同的基函数子类:一类可以以无矩阵方式快速应用,另一类可以通过 TN 分解近似。因此,我们引入了 DNN 的两步优化过程:给定一组输入特征后,通过经典梯度下降技术递归地优化 DNN 参数,迭代次数固定。参数优化结束后,评估并更新基函数以改善收敛。基函数修改后,初始化新的 DNN 并恢复参数训练。本工作与随机特征训练有相似之处,因为 DNN 现在可以被视为其输入层和神经元层的组合。与随机特征训练一样,我们在 DNN 训练期间固定与输入级特征相关的参数。一个主要区别是特征的交互由 DNN 参数层隐式促进。这使 DNN 的特征层具有类似于秩 1 TN 分解的外积结构。因此,我们将此技术称为张量特征训练。
如前所述,我们将引入在其域上离散化并分解的 DNN。为此分解,我们将利用典型多因子分解 \(CPD\)。[7](https://arxiv.org/html/2608.10351#bib.bib8), [3](https://arxiv.org/html/2608.10351#bib.bib10), [6](https://arxiv.org/html/2608.10351#bib.bib9) 我们仅选择单一的张量分解策略以简化过程分析。在实践中,可以使用任何类型或组合的张量分解。此外,可以将张量分解(如 CPD 和张量列分解)理解为使用由一维核矩阵的张量积构造的核矩阵来计算高维高斯过程的方法。[25](https://arxiv.org/html/2608.10351#bib.bib15), [27](https://arxiv.org/html/2608.10351#bib.bib16) 因此,我们希望证明以下几点:第一,张量特征的引入在 DNN 优化中起到正则化器的作用;第二,张量分解通过向张量核矩阵引入非局部特征,对 DNN 起到平滑作用。由于张量分解在计算时间和内存方面都可能极其昂贵,我们将利用随机化线性代数的最新进展来高效分解高维函数。
本文其余部分的结构如下:在第 II 节中,我们将讨论工作的理论背景,包括随机化典型多因子分解以及张量分解与高维函数高斯过程之间的关系。在第 III 节中,我们描述实验总体框架,以学习维数从 5 到 40 不等的 PDE 解函数。在第 IV 节中,我们提供优化实验的结果,将我们的结果与经典优化策略进行比较,并讨论改进 DNN 学习未知函数优化过程的方法。最后,在第 V 节中,我们总结发现并讨论未来方向和改进。
## II 理论背景
### II.1 典型多因子分解
CPD 是奇异值分解的高阶推广,它将一个 \(d\) 变量函数(表示为 \(d\) 阶张量)表示为单变量外积的和,即给定 \(\mathcal{T}\in\mathbb{R}^{I_1,I_2,\dots,I_d}\),
\[
t_{a,b,\dots,n}\overset{\mathrm{CPD}}{=}\sum_{i=1}^{R_{\mathrm{CP}}}\lambda_i{\bf a}_i\circ{\bf b}_i\circ\dots\circ{\bf n}_i
\tag{1}
\]
其中 \(\circ\) 定义向量外积,\({\bf a}_i\in\mathbb{R}^{I_1},{\bf b}_i\in\mathbb{R}^{I_1},\dots,{\bf n}_i\in\mathbb{R}^{I_d}\),\(\lambda_i\) 是一个缩放常数,使向量 \([a_i,\dots n_i]\) 可以单位归一化,而 \(R_{\mathrm{CP}}\)相似文章
用于深度神经网络指数级压缩的自动可微非线性张量网络(ADNTNs)
介绍了用于压缩深度神经网络层的自动可微非线性张量网络(ADNTNs),通过小型核心张量实现高压缩比同时保持准确性。
面向大规模动态加权有向网络的张量潜在因子超参数学习方法
本文提出一种基于差分进化的张量潜在因子自动超参数优化框架,以提高大规模动态加权有向网络的预测精度,减少手动调参需求。
使用 Data-Centric Parallel 训练可变长序列
介绍了 Data-Centric Parallel (DCP),一种通过在每批次动态调整运行时设置来训练变长序列深度学习模型的方法,在 32 个 H200 GPU 上实现了高达 2.88 倍的加速,仅需集成 10 行代码。
预测随机低维重参数化何时能训练神经网络
本文分析了随机低维重参数化何时能训练神经网络,推导出随机切片残差的取向分辨主公式,并引入RaMaN——一个可扩展框架,能以极低内存成本预测所需潜在维度。
利用测试时训练线性化视觉Transformer
本文提出了一种方法,将预训练的Softmax注意力模型转换为线性复杂度的测试时训练(TTT)架构,在显著加速推理的同时,实现了与微调Softmax模型相当的文生图质量。该方法通过对Stable Diffusion 3.5进行线性化得到SD3.5-T^5,在1K分辨率下实现1.32倍加速。