通过超球面流形学习的轻量级自适应ReduNet
摘要
本文提出LA-ReduNet,一种轻量级自适应架构,该架构采用超球面流形学习和自适应步长,以显著减少神经网络中MCR2目标所需的层数,并用更少的参数实现相当的分类准确率。
arXiv:2608.20668v1 公告类型:新
摘要:近年来,一种名为ReduNet的白盒神经网络被提出,它采用最大编码率缩减(MCR$^2$)原理,通过前向逐层构建过程将原始数据转换为低维判别特征。与依赖反向传播的传统深度网络不同,ReduNet明确地从上一层的特征推导出每一层的参数,提供了一种数学上可解释的范式。然而,这种逐层构建通常需要大量层才能使MCR$^2$目标达到稳定值,这增加了展开模块的参数存储。为了解决这个问题,我们提出了LA-ReduNet,一种轻量级自适应架构,它改进了逐层更新规则,并允许以显著更少的展开层获得判别特征表示。具体来说,LA-ReduNet采用超球面流形学习和自适应步长,从而将MCR$^2$目标达到稳定值所需的层数减少一个数量级。仿真结果表明,在保持相当分类准确率的同时,LA-ReduNet需要显著更少的层才能使MCR$^2$目标达到稳定值。值得注意的是,在所考虑的实验设置下,LA-ReduNet仅需要约$1/29$的展开ReduNet模块的参数存储,即可使MCR$^2$目标达到稳定值。
查看缓存全文
缓存时间: 2026/08/24 04:32
# 基于超球面流形学习的轻量级自适应ReduNet 来源:https://arxiv.org/html/2608.20668 严启发 邮箱:[[email protected]](mailto:) 通讯作者:通讯作者 戴斌 邮箱:[[email protected]](mailto:) 唐晓虎 邮箱:[[email protected]](mailto:) 地址:中国四川省成都市西南交通大学信息科学与技术学院,邮编 610031;中国四川省成都市西南交通大学信息编码与传输重点实验室,科技部国际联合研究中心(CSNMT),邮编 611756 ###### 摘要 近年来,一种名为ReduNet的白盒神经网络被提出,该网络采用最大编码率降低(MCR^2)原理,通过前向逐层构建过程将原始数据转化为低维判别特征。与依赖反向传播的传统深度网络不同,ReduNet显式地从其前一层的特征推导出每一层的参数,提供了一种数学上可解释的范式。然而,这种逐层构建通常需要大量层才能使MCR^2目标达到稳定值,从而增加了展开模块的参数存储量。为解决此问题,我们提出了LA-ReduNet,一种轻量级自适应架构,它改进了逐层更新规则,使得能够用显著更少的展开层获得判别性特征表示。具体而言,LA-ReduNet采用超球面流形学习和自适应步长,从而将MCR^2目标达到稳定值所需的层数减少了一个数量级。仿真结果表明,在保持相当分类精度的同时,LA-ReduNet使MCR^2目标达到稳定值所需的层数显著减少。值得注意的是,在所考虑的实验设置下,LA-ReduNet所需的参数存储量仅为展开ReduNet模块达到MCR^2目标稳定值时所需的大约1/29。 ###### 关键词:最大编码率降低(MCR^2),白盒神经网络,流形学习,特征提取 ## 1 引言 人工智能(AI)的快速发展推动了其在其他领域应用的研究[9]。这一发展中的一个重要里程碑发生在2016年,当时AI程序AlphaGo[20, 19]击败了围棋世界冠军李世石。目前,基于深度学习的算法被广泛应用于自动驾驶[24]、疾病检测[16]、图像分类[3]、人脸识别[2]和语义通信[7]等多个领域。然而,在某些场景下,例如自动驾驶,需要模型具有更高的可解释性。因此,可解释人工智能(XAI)的研究吸引了广泛关注并迅速发展[9]。尽管黑盒神经网络的研究取得了显著进展[17, 18, 8],但其可解释性仍然有限。在此背景下,Chan等人提出了一种名为ReduNet的新颖白盒神经网络[5],提供了不同于传统方法的视角。与直接解释黑盒神经网络内部机制的传统方法相比,ReduNet从优化目标推导出网络架构,从而减少了对人工经验设计网络架构的依赖。更具体地说,ReduNet的网络架构源自最大编码率降低(MCR^2)原理。与传统的交叉熵(CE)损失函数不同,MCR^2原理修改了学习目标,旨在明确捕捉高维数据潜在的低维结构,而非主要关注标签拟合[22]。MCR^2原理利用率失真来衡量表示的紧凑性。MCR^2原理的目标是最大化特征的整体编码率,同时最小化类内编码率,其中编码率通过多元高斯率失真(RD)函数计算。 关于ReduNet的现有研究大致可分为两类。第一类侧重于改进ReduNet,例如ESS-ReduNet[21]、Multi-ReduNet[12]和AR-ReduNet[10]。第二个方向是将ReduNet应用于其他领域,例如合成孔径雷达(SAR)目标识别[25]、雷达干扰识别[26]和染色体分类[23]。尽管取得了这些进展,ReduNet中的逐层优化仍然依赖于欧几里得梯度更新后进行归一化。因此,欧几里得空间中的固定步长并不直接控制特征在球面上的实际角度位移,这可能导致跨样本的角度更新很小或高度可变。 受此观察启发,我们提出了一种基于超球面流形学习、具有自适应步长的轻量级ReduNet,称为轻量级自适应ReduNet(LA-ReduNet)。与基于梯度上升的ReduNet相比,LA-ReduNet显著减少了所需的展开层数,并相应地减少了展开模块的参数存储量。仿真结果表明,LA-ReduNet不仅实现了更轻量级的网络架构,而且在分类精度上优于基于梯度上升的ReduNet。 特别地,LA-ReduNet采用了与AR-ReduNet相同的自适应多元高斯RD近似函数。AR-ReduNet通过引入这种自适应近似函数改进了ReduNet,该函数提供了更精确的编码率近似并提高了分类性能[10]。LA-ReduNet并非进一步修改编码率近似,而是专注于在单位球面约束下重新设计ReduNet的逐层更新规则。因此,AR-ReduNet将作为后续比较中的基线。 应当指出,球面上的黎曼优化已建立完善[1, 4]。因此,LA-ReduNet的新颖性不在于使用切空间或测地线更新本身。相反,我们开发了一种归一化、截断且样本自适应的黎曼更新方案,专为前向逐层MCR^2构建量身定制,其中每次更新直接展开为一个网络层。 本文的主要贡献总结如下: 1. LA-ReduNet在单位球面约束下为ReduNet引入了一种重新设计的逐层更新规则。具体来说,我们观察到ReduNet中欧几里得更新后进行归一化并不直接控制每个特征在单位球面上的实际角度位移。相应地,构建了一种截断和归一化的黎曼更新方案,其中可行的更新方向在切空间中显式确定,而角度步长则根据每个样本的欧几里得梯度与径向方向之间的余弦相似度为其自适应调整。此外,通过阈值机制排除黎曼更新方向范数足够小的样本进行进一步更新。由此产生的更新方案自然与ReduNet的逐层展开兼容,因此可以直接作为一系列网络层实现。 2. 分析了所提出的黎曼更新方案的理论性质。特别地,证明了黎曼更新映射的利普希茨连续性,并在单位球的乘积上推导出了MCR^2目标增量的下界不等式。基于这些结果,进一步建立了在给定阈值和步长条件下所提算法的有限终止性质。 3. 在CIFAR-10、CIFAR-100和CINIC-10数据集上的仿真结果表明,LA-ReduNet使MCR^2目标和分类精度达到稳定所需的展开层数显著减少。具体而言,LA-ReduNet在约5-10层内即可实现分类精度收敛。此外,在我们的实验中,当ReduNet使用其原始步长设置,而LA-ReduNet采用相对较小的基础步长时,LA-ReduNet使MCR^2目标达到稳定值所需的层数显著减少。具体而言,LA-ReduNet在所考虑的设置下大约需要35层即可实现该目标收敛,而ReduNet则需要大约1000层,对应于ReduNet所需参数存储量的约1/29。 本文其余部分的组织结构如下:第2节回顾了MCR^2原理、ReduNet和AR-ReduNet的必要预备知识。第3节介绍了LA-ReduNet并建立了其有限终止性质。第4节介绍了在多个数据集上的仿真结果,第5节总结了本文。 ## 2 预备知识 本节简要介绍了MCR^2[22]、基于MCR^2原理的ReduNet[5]及其改进版本AR-ReduNet[10]。 ### 2.1 MCR^2原理与ReduNet框架 考虑样本集$\bm{X}=[\bm{x}_1,\bm{x}_2,\ldots,\bm{x}_m]\in\mathbb{R}^{n\times m}$,$\bm{x}\in\mathbb{R}^n$是一个样本点。令$\bm{z}_i$是特征$\bm{x}_i$的变换。对于集合$\bm{X}$,$\bm{Z}=[\bm{z}_1,\bm{z}_2,\ldots,\bm{z}_m]\in\mathbb{R}^{n\times m}$是特征矩阵。根据MCR^2原理[22],$\bm{Z}$通过优化以下问题进行更新: $$ \underset{\bm{Z}}{\rm maximize}\hskip 10.00002pt\Delta R(\bm{Z},\epsilon,\bm{\Pi})=R(\bm{Z},\epsilon)-\sum_{j=1}^{k}R^{\rm c}(\bm{Z},\epsilon|\bm{\Pi}_{j}), \tag{1} $$ $$ {\rm s.t.}\hskip 10.00002pt\bm{z}_1,\ldots,\bm{z}_m\in\mathbb{S}^{n-1}, $$ 其中$\mathbb{S}^{n-1}$表示$n$维空间中的单位球面。式(1)中的符号解释如下: 1. 样本的隶属关系由一组$k$个对角矩阵$\bm{\Pi}=\{\bm{\Pi}_{j}\}_{j=1}^{k}$描述,其中$\bm{\Pi}_j$是第$j$类的隶属矩阵,定义为 $$ \bm{\Pi}_{j}={\rm diag}(\pi_{1,j},\pi_{2,j},\ldots,\pi_{m,j})\in\mathbb{R}^{m\times m}, \tag{2} $$ 其中$\pi_{i,j}$是第$i$个样本的标签,即 $$ \pi_{i,j}=\Bigg\{\begin{array}{ll}1,&\mbox{如果 $\bm{x}_i$ 属于类 $j$}\\ 0,&\mbox{其他}\end{array}. $$ 根据定义,对角矩阵$\bm{\Pi}=\{\bm{\Pi}_{j}\}_{j=1}^{k}$属于单纯形$\{\bm{\Pi}:\pi_{ij}\geq0,\sum_{j=1}^{k}\bm{\Pi}_{j}=\bm{I}\}$。 2. 函数$R(\bm{Z},\epsilon)$是编码$\bm{Z}$所需的最小二进制位数,使得期望解码误差小于$\epsilon^2$,而$R^{\rm c}(\bm{Z},\epsilon|\bm{\Pi}_{j})$是每类最小二进制位数的总和。特别地,考虑一个来自零均值多元高斯分布$\bm{z}\sim\mathcal{N}(0,\bm{\Sigma})$的向量源$\bm{z}\in\mathbb{R}^n$,编码$\bm{Z}$所需二进制位数的近似由下式给出[14] $$ R(D)\triangleq\frac{1}{2}\log\det\Big(\bm{I}+\frac{n}{D}\bm{\Sigma}\Big), \tag{5} $$ 在目标函数(1)中,$R(\bm{Z},\epsilon)$是失真度$D=\epsilon^2$下整个特征集的最小编码长度,近似为 $$ R(\bm{Z},\epsilon)\triangleq\frac{1}{2}\log\det\Big(\bm{I}+\frac{n}{m\epsilon^2}\bm{ZZ}^{\rm T}\Big), \tag{6} $$ 其中$\bm{\Sigma}$被其估计值$\bm{ZZ}^{\rm T}/m$替代。而第$j$类的最小编码长度近似为 $$ R^{\rm c}(\bm{Z},\epsilon|\bm{\Pi}_{j})\triangleq\frac{{\rm tr}(\bm{\Pi}_{j})}{2m}\log\det\left(\bm{I}+\frac{n}{{\rm tr}(\bm{\Pi}_{j})\epsilon^{2}}\bm{Z}\bm{\Pi}_{j}\bm{Z}^{\rm T}\right). \tag{7} $$ 即第$j$类的协方差矩阵近似为$\bm{Z}\bm{\Pi}_{j}\bm{Z}^{\rm T}/{\rm tr}(\bm{\Pi}_{j})$,第$j$类的权重为${\rm tr}(\bm{\Pi}_{j})/m$。 图1:ReduNet的单层结构。基于MCR^2原理,ReduNet的架构可以直接从目标函数(1)推导出来。如图1所示,特征矩阵$\bm{Z}$通过梯度上升进行更新。即 $$ \bm{Z}^{(\ell)}\propto\bm{Z}^{(\ell-1)}+\eta\bm{E}^{(\ell)}\bm{Z}^{(\ell-1)}-\eta\Big(\sum_{j=1}^{k}\bm{C}_{j}^{(\ell)}\bm{Z}^{(\ell-1)}\bm{\Pi}_{j}^{(\ell-1)}\Big), $$ $$ \hskip 10.00002pt{\rm s.t.}\hskip 10.00002pt\bm{z}_1^{(\ell)},\ldots,\bm{z}_m^{(\ell)}\in\mathbb{S}^{n-1}, \tag{8} $$ 其中$\eta$是步长,矩阵$\bm{E}^{(\ell)}$和$\bm{C}_{j}^{(\ell)}$是$\bm{E}$和$\bm{C}_j$在时间$\ell$的值。
相似文章
通过注意力头重加权实现大语言模型的数据高效适配
介绍了一种数据高效方法——注意力头重加权(AHR),通过为每个注意力头学习单个标量来适配大语言模型至文本分类任务,大幅减少可训练参数,同时在有限数据场景下优于LoRA。
预测随机低维重参数化何时能训练神经网络
本文分析了随机低维重参数化何时能训练神经网络,推导出随机切片残差的取向分辨主公式,并引入RaMaN——一个可扩展框架,能以极低内存成本预测所需潜在维度。
并行流形引导:通过残差能量塑形实现大型关联记忆的高效适应
本文提出H-Res,一种通过塑形关联记忆的能量景观来适应大型Transformer模型的方法,无需修改权重或添加提示,保留了记忆容量,且性能优于LoRA。
归一化低秩适应
归一化低秩适应 (NoRA) 通过归一化下投影矩阵来稳定 LoRA 训练,加速收敛并提高性能,无需额外参数或推理成本。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。