CAWI:面向随机神经网络的Copula对齐权重初始化方法
摘要
介绍CAWI,一种基于Copula的随机神经网络权重初始化方法,该方法建模特征间依赖关系,在83个分类基准上提升了预测性能。
arXiv:2605.12580v1 Announce Type: new
摘要:随机神经网络通过冻结随机初始化的输入到隐藏层权重,实现了高效且无需反向传播的训练,从而允许输出层存在闭式解。然而,传统的随机初始化忽略了特征间的依赖关系,未能考虑数据中的相关性、非对称性和尾部依赖,导致条件数和预测性能下降。据我们所知,这一局限性在随机神经网络文献中尚未得到解决。为弥补这一空白,我们提出了CAWI(Copula对齐权重初始化)框架,该框架从拟合数据经验的Copula中抽取输入到隐藏层权重,确保被冻结的投影尊重特征间依赖关系,同时不牺牲闭式解。CAWI:(i)使用经验累积分布函数将每个特征映射到单位区间;(ii)拟合一个捕捉特征间秩依赖的多变量Copula;(iii)从拟合的Copula中采样每个权重列w_j,并应用固定的逆边际变换来设定尺度。目标函数、求解器和“一次冻结”范式保持不变;仅W的采样规则变为依赖感知。在依赖建模方面,我们考虑两类Copula族:椭圆族(高斯、t)和阿基米德族(克莱顿、弗兰克、冈贝尔)。这使得CAWI能够处理多样化的依赖关系,包括尾部依赖。我们使用标准浅层和深层随机神经网络架构,在83个多样化的分类基准(二分类和多分类)以及两个生物医学数据集(BreaKHis和精神分裂症数据集)上评估CAWI。CAWI在预测性能上持续显著优于传统随机初始化。代码可在以下地址获取:https://github.com/mtanveer1/CAWI
查看缓存全文
缓存时间: 2026/05/14 06:16
# 1 引言 来源:https://arxiv.org/html/2605.12580 CAWI:面向随机神经网络的Copula对齐权值初始化方法 Mushir Akhtar、M. Tanveer、Mohd. Arshad 印度理工学院印多尔校区,Simrol,印多尔,453552,印度 ###### 摘要 随机神经网络(RdNN)通过固定随机初始化的输入到隐藏层权重,实现了高效、无需反向传播的训练,从而允许输出层采用闭式解。然而,传统的随机初始化忽略了特征间的依赖关系——忽略了数据中的相关性、非对称性和尾部依赖性——这损害了条件数和预测性能。据我们所知,这一局限性在RdNN文献中尚未得到解决。为弥补这一空白,我们提出CAWI(Copula对齐权值初始化),该框架从拟合数据特征的Copula中抽取输入到隐藏层权重,从而在保留闭式解的同时,确保冻结的投影尊重特征间依赖性。CAWI:(i) 使用经验CDF将每个特征映射到单位区间,(ii) 拟合能够捕捉特征间秩相关依赖关系的多元Copula,(iii) 从拟合的Copula中采样每个权重列w_j,并应用固定的逆边际变换来设置尺度。目标函数、求解器和“冻结一次”范式保持不变;仅改变W的采样法则,使其具有依赖感知能力。在依赖建模方面,我们考虑两类Copula族:椭圆族(高斯、t)和阿基米德族(Clayton、Frank、Gumbel)。这使得CAWI能够处理多种依赖关系,包括尾部依赖。我们在83个多样化的分类基准(二分类和多分类)以及两个生物医学数据集(BreaKHis和精神分裂症数据集)上,使用标准的浅层和深层RdNN架构评估了CAWI。CAWI相比传统随机初始化,在预测性能上始终带来显著提升。代码见:https://github.com/mtanveer1/CAWI。
深度学习(DL)模型从图像识别Voulodimos等人(2018) (https://arxiv.org/html/2605.12580#bib.bib14);Chen等人(2019) (https://arxiv.org/html/2605.12580#bib.bib37);Liu等人(2024) (https://arxiv.org/html/2605.12580#bib.bib55)到自然语言处理Otter等人(2021) (https://arxiv.org/html/2605.12580#bib.bib15);Lauriola等人(2022) (https://arxiv.org/html/2605.12580#bib.bib38);Yin等人(2024) (https://arxiv.org/html/2605.12580#bib.bib56)等多个领域取得了显著成功,这得益于其能够学习数据的丰富层次化表示LeCun等人(2015) (https://arxiv.org/html/2605.12580#bib.bib17);Luo等人(2023) (https://arxiv.org/html/2605.12580#bib.bib74)。使用反向传播的端到端训练优化数百万个参数以最小化任务特定损失,从而产生富有表现力的特征和强大的泛化能力。然而,最先进的性能通常需要大量的计算、广泛的超参数搜索和较长的训练周期Goodfellow (2016) (https://arxiv.org/html/2605.12580#bib.bib39);Tiwari等人(2023) (https://arxiv.org/html/2605.12580#bib.bib75)。此外,训练深层架构可能会受到梯度消失或爆炸的阻碍Pascanu等人(2013) (https://arxiv.org/html/2605.12580#bib.bib40);Jaiswal等人(2022) (https://arxiv.org/html/2605.12580#bib.bib57);Ceni (2025) (https://arxiv.org/html/2605.12580#bib.bib76)。前述深度学习模型的局限性促使研究人员寻求替代性神经架构,这些架构能够在显著降低训练成本的同时,保持有竞争力的预测性能。一个重要的类别是随机神经网络(RdNN)Pao等人(1994) (https://arxiv.org/html/2605.12580#bib.bib22);Cao等人(2018) (https://arxiv.org/html/2605.12580#bib.bib19);Suganthan和Katuwal (2021) (https://arxiv.org/html/2605.12580#bib.bib58);Hu等人(2024) (https://arxiv.org/html/2605.12580#bib.bib59)。在RdNN中,大量参数——通常是输入到隐藏层权重——从简单分布中采样一次后固定不动,而剩余的(通常是输出层)权重则通过求解单个线性系统(通常使用Tikhonov正则化)来获得,而不是通过迭代反向传播Zhang和Suganthan (2016) (https://arxiv.org/html/2605.12580#bib.bib18)。这种范式消除了迭代权重更新的需要,大幅减少了训练时间和计算开销,但仍允许RdNN学习复杂的输入-输出映射Zhang和Suganthan (2016) (https://arxiv.org/html/2605.12580#bib.bib18)。理论上,RdNN在紧致域上满足万能近似性质,只要宽度足够且激活函数适当,可以任意逼近任何连续函数Igelnik和Pao (1995) (https://arxiv.org/html/2605.12580#bib.bib25);Needell等人(2024) (https://arxiv.org/html/2605.12580#bib.bib77)。近年来,RdNN取得了显著进展,特别是在提高其鲁棒性和可扩展性的方法方面。集成方法被引入以增强泛化能力并减少变异性Shi等人(2021) (https://arxiv.org/html/2605.12580#bib.bib60);Guo等人(2021) (https://arxiv.org/html/2605.12580#bib.bib61)。基于粒球的可扩展方法进一步将RdNN的应用范围扩展到大规模和高维数据集Sajid等人(2025a) (https://arxiv.org/html/2605.12580#bib.bib62)。此外,将模糊推理系统集成到RdNN框架中,提供了一种纳入不确定性处理和可解释性的方式,使其在复杂和不精确的决策任务中更加有效Sajid等人(2024a) (https://arxiv.org/html/2605.12580#bib.bib63), 2025b (https://arxiv.org/html/2605.12580#bib.bib64)。除这些趋势外,一系列技术进展拓宽了RdNN的工具箱Wong等人(2022) (https://arxiv.org/html/2605.12580#bib.bib83);Chen等人(2025) (https://arxiv.org/html/2605.12580#bib.bib84);Akhtar等人(2025) (https://arxiv.org/html/2605.12580#bib.bib105);Ren等人(2025) (https://arxiv.org/html/2605.12580#bib.bib85)。
尽管取得了几项进展,RdNN面临一个根本性的局限,这植根于其高效的机制:输入到隐藏层权重被随机初始化一次并在整个训练过程中保持固定。由于矩阵W∈R^{d×h}被冻结,诱导的特征映射x↦φ(xW+b)是非自适应的;隐藏表示H=φ(XW+1_m b^⊤)∈R^{m×h}因此由这个随机抽取决定,而不是从数据中学习。固定的表示H无法根据输入间的依赖关系(例如,相关性、相对尺度、高阶交互)进行调整,因此在实际隐藏维度h下,它可能无法充分代表驱动预测的联合模式。读出层随后计算Ŷ=HΘ,其中Θ∈R^{h×n};如果相关依赖关系在H中缺失,它们无法被恢复,导致持续的近似偏差和给定模型大小下较低的性能。
前述局限性自然引发了一个问题:我们能否在不放弃闭式训练的情况下,使冻结的投影具有依赖感知能力?在这项工作中,我们通过引入CAWI(Copula对齐权值初始化)来回答这个问题,这是一种使用Copula理论生成**依赖感知**输入到隐藏层权重的方法。Copula通过将单变量边际与联合依赖结构分离来对多元数据建模,允许我们在不承诺特定边际形式的情况下学习依赖关系Nelsen (2006) (https://arxiv.org/html/2605.12580#bib.bib86);Joe (2014) (https://arxiv.org/html/2605.12580#bib.bib87)。这种分离非常适合表格学习,其中特征尺度和边际变化很大,但预测信号往往存在于跨特征结构中。最近的研究表明Copula在人工智能中的广泛用途:用于时间序列预测的CopulaSun和Yu (2022) (https://arxiv.org/html/2605.12580#bib.bib94);Ashok等人(2024) (https://arxiv.org/html/2605.12580#bib.bib95),使用Copula和广义特征函数对CNN深度特征密度进行可解释估计Chapman和Farvardin (2024) (https://arxiv.org/html/2605.12580#bib.bib88),以及在依赖删失下具有可辨识性保证的生存分析Zhang等人(2024) (https://arxiv.org/html/2605.12580#bib.bib90)。进一步的发展包括Copula嵌套谱核网络Tian等人(2024) (https://arxiv.org/html/2605.12580#bib.bib92),具有任意边际的可扩展混合模型Simchoni和Rosset (2025) (https://arxiv.org/html/2605.12580#bib.bib89),以及神经Copula密度估计Letizia等人(2025) (https://arxiv.org/html/2605.12580#bib.bib93)等。在深度神经网络中,已有一些工作探索了结构化或数据感知的初始化策略,例如正交权重初始化Hu等人(2020) (https://arxiv.org/html/2605.12580#bib.bib102);Narkhede等人(2022) (https://arxiv.org/html/2605.12580#bib.bib101)和基于白化的变换LeCun等人(2002) (https://arxiv.org/html/2605.12580#bib.bib104);Kessy等人(2018) (https://arxiv.org/html/2605.12580#bib.bib103)。正交方案通过代数约束稳定信号传播,但对分布无感知,而白化通过协方差归一化使特征去相关,主要处理线性依赖关系。更一般地,数据依赖的投影方法修改特征空间(例如,通过PCA或核映射),通常会增加计算成本。相比之下,CAWI专为RdNN设计,其中隐藏权重被采样一次并保持固定。CAWI不改变特征表示或施加结构约束,而是仅使用拟合到训练特征的Copula来修改权重矩阵的采样分布。具体来说,我们构造基于秩的伪观测,估计椭圆(高斯、t)或阿基米德(Clayton、Frank、Gumbel)Copula,并从拟合的依赖结构中抽取W的每一列,同时保持边际尺度固定。由此产生的冻结投影继承了经验特征间的依赖关系,而RdNN架构、激活函数、目标和闭式求解器保持不变,基本上不增加额外的训练成本。
**我们的贡献**
- • 我们引入了CAWI(Copula对齐权值初始化),这是一种即插即用的方案,通过从拟合训练特征的Copula中采样W的列,使随机神经网络具有依赖感知能力,同时保留闭式求解器和“冻结一次”范式。
- • 我们提供了基于秩估计和最近SPD投影的椭圆(高斯、t)和阿基米德(Clayton、Frank、Gumbel)Copula的数值稳定构造。
- • 我们在83个多样化的分类基准(二分类和多分类)和两个生物医学数据集(BreaKHis和精神分裂症数据集)上,使用浅层和深层RdNN架构评估了CAWI,观察到一致的改进,在某些数据集上相对增益达到4-5%。
## 2 预备知识
### 2.1 随机神经网络(RdNN)设置
设X∈R^{m×d}为输入矩阵(m个样本,d个特征),Y∈R^{m×n}为目标矩阵(例如,独热标签)。RdNN通过采样一个**冻结**的权重矩阵W∼D_W⊂R^{d×h}, b∈R^{h}来构造一个有h个单元的单隐藏层,该矩阵来自预设的基分布(经典地,独立同分布均匀或高斯分布,坐标间独立),然后**永不更新**这些参数。使用元素级非线性φ:R→R,隐藏表示为
H = φ(XW + 1_m b^⊤) ∈ R^{m×h}, (1)
其中1_m表示一个m维全1向量以广播偏置。
训练简化为仅通过岭回归拟合输出权重Θ∈R^{h×n}:
Θ^⋆ ∈ arg min_{Θ∈R^{h×n}} ‖HΘ - Y‖_F^2 + (λ/2)‖Θ‖_F^2, λ≥0, (2)
它具有标准的闭式形式:
(原始) Θ^⋆ = (H^⊤H + λI_h)^{-1} H^⊤Y, (3)
(对偶) Θ^⋆ = H^⊤ (HH^⊤ + λI_m)^{-1} Y. (4)
因此**不需要反向传播**:一旦W和b被采样,训练就是一个线性求解。标准RdNN模型的详细公式和架构在附录A节 (https://arxiv.org/html/2605.12580#A1)中讨论。
### 2.2 Copula
Copula是隔离和建模**依赖**与**边际**分离的经典工具Nelsen (2006) (https://arxiv.org/html/2605.12580#bib.bib86);Joe (2014) (https://arxiv.org/html/2605.12580#bib.bib87)。Sklar的奠基性结果表明,任何多元分布都可以通过一个单位超立方体上的函数来耦合其单变量边际,从而将多元建模简化为估计边际和[0,1]^d上的依赖映射Sklar (1959) (https://arxiv.org/html/2605.12580#bib.bib97)。
##### Copula: 设X=(X_1, ..., X_d)是一个随机向量,其边际累积分布函数(CDF)为F_j(t)=Pr[X_j≤t],j=1,...,d。**与X相关的Copula**是变换后的向量(F_1(X_1), ..., F_d(X_d))∈[0,1]^d的联合CDF,即
C(u_1, ..., u_d) = Pr{ F_1(X_1)≤u_1, ..., F_d(X_d)≤u_d }, (5)
(u_1, ..., u_d)∈[0,1]^d。
等价地,一个d维Copula是[0,1]^d上的分布函数,其单变量边际在(0,1)上均匀。图1 (https://arxiv.org/html/2605.12580#S2.F1)直观展示了该概念。
##### 不变性: 如果每个j的ψ_j严格递增,则(ψ_1(X_1), ..., ψ_d(X_d))与(X_1, ..., X_d)具有相同的Copula。因此Copula仅取决于跨坐标的顺序,而不依赖于单位或尺度。
*图1注释:*
图1: Copula示意图。*左:* 经验样本(附其联合CDF插图)。*中:* 单变量CDF F_1和F_2(将x_j映射为u_j=F_j(x_j))。*右:* Copula曲面C(u_1, u_2),即[0,1]^2上具有均匀边际的联合CDF。等号表示Sklar分解式F(x_1,x_2)=C(F_1(x_1),F_2(x_2));⊕符号强调C将边际信息组合成依赖结构。
##### Sklar定理: 设F:R^d→[0,1]是X=(X_1, ..., X_d)的联合CDF。相似文章
从权重扰动到特征归因:解释全连接神经网络
提出一种基于权重扰动的特征归因方法(XWP和XWPc),用于全连接神经网络,在标准基线指标上取得了有竞争力的性能。
使用悲观评论家的协作加权方法缓解离策略强化学习中的过估计
提出了一种协作加权演员-评论家(CWAC)框架,该框架使用分布式评论家和协作加权机制来缓解离策略强化学习中的过估计偏差。
PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR
This paper introduces PAIR, a pairwise-aware inclusion reweighting method for adaptive rollout allocation in RLVR, improving sample efficiency and accuracy over pointwise allocators by correcting biases in pairwise gradient estimation.
WeCon: 一种高效的多目标组合优化问题权重条件神经求解器
介绍WeCon,一种用于多目标组合优化问题的权重条件神经求解器,其超体积与现有最优方法相当,同时推理时间减少40%。
S-GAI: 谱几何感知初始化用于Sigmoid多层感知器——从数据集几何到网络权重
S-GAI是一种针对单隐层Sigmoid多层感知器的谱几何感知初始化框架,它利用图像数据的逐类谱几何来初始化权重。在初始隐藏状态质量方面优于随机初始化,并在MNIST和CIFAR-10等基准测试上达到可比的最终准确率。