鲁棒双模型协作随机向量函数链网络

arXiv cs.LG 论文

摘要

本文提出了一种鲁棒双模型协作随机向量函数链网络(KRPRVFL),通过利用核风险敏感均值p幂准则和协作学习,以在存在噪声标签和离群点的情况下提高分类准确性。

arXiv:2608.13628v1 Announce Type: new 摘要: 随机向量函数链(RVFL)网络是轻量级且快速的神经网络模型,通过随机隐藏层权重和直接输入输出连接提供高效的训练和强大的泛化能力。然而,传统的RVFL模型对噪声标签、离群点和不平衡数据敏感,这限制了它们在实际应用中的性能。为了解决这些挑战,我们提出了基于核风险敏感均值p幂的RVFL(KRPRVFL)模型,该模型将RVFL的计算效率与核风险敏感均值p幂(KRP)准则的鲁棒性相结合。通过用基于KRP的损失替代标准最小二乘目标,KRPRVFL在训练过程中自适应地减少损坏或不可靠样本的影响,从而提高稳定性和泛化能力。此外,引入了协作学习机制,以实现模型组件之间的自适应交互,进一步增强了在复杂和噪声环境中的鲁棒性。所提出的框架还利用核诱导特征映射来捕获非线性关系,无需显式隐藏层选择,保持了效率和可扩展性。在UCI和KEEL基准数据集上的大量实验表明,KRPRVFL在准确性、鲁棒性和统计显著性方面始终优于基线模型,突出了其作为快速、可扩展且可靠的解决方案在具有挑战性的分类任务中的有效性。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:10

# 未命名文档 来源:https://arxiv.org/html/2608.13628
A. Quadir 附属机构:印度理工学院印多尔分校数学系 [email protected]
A. Rahaman 附属机构:印度理工学院印多尔分校数学系 [email protected]
Mushir Akhtar 附属机构:印度理工学院印多尔分校数学系 [email protected]
M. Tanveer \*备注:\* 通讯作者 附属机构:印度理工学院印多尔分校数学系 [email protected]

## 鲁棒的双模型协作随机向量泛函链接网络
A. Quadir 附属机构:印度理工学院印多尔分校数学系 [email protected]
A. Rahaman 附属机构:印度理工学院印多尔分校数学系 [email protected]
Mushir Akhtar 附属机构:印度理工学院印多尔分校数学系 [email protected]
M. Tanveer \*备注:\* 通讯作者 附属机构:印度理工学院印多尔分校数学系 [email protected]

###### 摘要
随机向量泛函链接(RVFL)网络是一种轻量级且快速的神经网络模型,通过随机化的隐藏层权重和直接的输入-输出连接提供高效的训练和强泛化能力。然而,传统的RVFL模型对噪声标签、离群值和不平衡数据敏感,限制了其在现实世界应用中的性能。为应对这些挑战,我们提出了基于核风险敏感均值 p 幂的RVFL(KRPRVFL)模型,该模型将RVFL的计算效率与核风险敏感均值 p 幂(KRP)准则的鲁棒性相结合。通过用基于KRP的损失替代标准最小二乘目标,KRPRVFL在训练过程中自适应地降低了损坏或不可靠样本的影响,从而提高了稳定性和泛化能力。此外,我们引入了一种协作学习机制,使得模型组件之间能够进行自适应交互,进一步增强了在复杂和噪声环境中的鲁棒性。所提出的框架还利用核诱导的特征映射来捕获非线性关系,无需显式选择隐藏层,同时保持了效率和可扩展性。在UCI和KEEL基准数据集上的大量实验表明,KRPRVFL在准确率、鲁棒性和统计显著性方面始终优于基线模型,凸显了其作为应对挑战性分类任务的快速、可扩展且可靠解决方案的有效性。论文代码和补充材料可通过以下链接访问:https://github.com/mtanveer1/KRPRVFL。

###### 索引术语:核风险敏感均值 p 幂(KRP)准则,随机向量泛函链接(RVFL)网络,双模型协作,标签噪声。

## I 引言
近年来,深度学习已成为人工智能领域的主导范式,并在广泛应用中取得了显著成功\[1 (https://arxiv.org/html/2608.13628#bib.bib1), 2 (https://arxiv.org/html/2608.13628#bib.bib2)\]。尽管具有强大的表示和学习能力,深度学习模型通常依赖于复杂的架构并涉及大量超参数,这使得训练过程计算成本高昂且耗时\[3 (https://arxiv.org/html/2608.13628#bib.bib3)\]。为解决这些局限性,Pao 等人 1994 (https://arxiv.org/html/2608.13628#bib.bib4) 提出了随机向量泛函链接(RVFL)网络,它提供了一种轻量级的替代方案,具有简单的架构和减少的可调参数集,无需迭代参数更新即可实现快速学习\[5 (https://arxiv.org/html/2608.13628#bib.bib5)\]。RVFL是一种浅层前馈随机神经网络,其隐藏层权重是随机生成的,并在训练过程中保持固定。RVFL的一个显著特点是输入层和输出层之间存在直接连接\[6 (https://arxiv.org/html/2608.13628#bib.bib6), 7 (https://arxiv.org/html/2608.13628#bib.bib7)\]。这些跳跃连接提供了一种隐式的正则化形式,与传统的随机神经网络相比,增强了学习稳定性并提高了泛化性能\[8 (https://arxiv.org/html/2608.13628#bib.bib8), 9 (https://arxiv.org/html/2608.13628#bib.bib9)\]。为了进一步提高标准RVFL框架的泛化能力,已经提出了许多改进的变体,旨在提高鲁棒性和实际有效性\[10 (https://arxiv.org/html/2608.13628#bib.bib10), 11 (https://arxiv.org/html/2608.13628#bib.bib11)\]。
RVFL对所有训练样本一视同仁,这可能使模型容易受到噪声和离群值的影响\[12 (https://arxiv.org/html/2608.13628#bib.bib12), 13 (https://arxiv.org/html/2608.13628#bib.bib13)\]。为缓解这一缺点,\[14 (https://arxiv.org/html/2608.13628#bib.bib14)\]中引入了直觉模糊RVFL(IFRVFL)模型,其中使用模糊隶属度和非隶属度函数为单个样本分配直觉模糊分数,从而减少不可靠数据的影响。
此外,在传统RVFL中,输入特征被映射到一个随机特征空间,这可能在学习到的表示中引入不稳定性。为缓解这一问题,Zhang 等人 2019 (https://arxiv.org/html/2608.13628#bib.bib15) 将带有 \(\ell_1\) 范数正则化的稀疏自编码器集成到RVFL框架中,从而开发了SP-RVFL模型。通过对学习到的表示强制稀疏性,该方法减少了随机特征映射引入的不利影响,并促进了更稳定和更具信息性的特征提取。
最近,RVFL的复数域扩展已被引入,以解决实数值模型在复数信号处理中的局限性\[16 (https://arxiv.org/html/2608.13628#bib.bib16)\]。特别是,CRVFL及其增强变体有效地利用了复数统计和实部与虚部之间的相关性,在复数学习任务中实现了性能提升和计算效率,同时保持了RVFL的快速训练优势\[17 (https://arxiv.org/html/2608.13628#bib.bib17)\]。尽管这些扩展的RVFL变体在一定程度上增强了鲁棒性,但它们对于有效处理现实世界应用中常见的重度污染或噪声数据的分类任务仍然不够充分\[18 (https://arxiv.org/html/2608.13628#bib.bib18)\]。
核风险敏感均值(p)幂(KRP)准则在再生核希尔伯特空间(RKHS)中对于鲁棒学习非常有效\[19 (https://arxiv.org/html/2608.13628#bib.bib19)\]。通过将基于核的非线性映射与风险敏感公式相结合,它提高了对噪声、离群值和数据不平衡的鲁棒性\[20 (https://arxiv.org/html/2608.13628#bib.bib20), 21 (https://arxiv.org/html/2608.13628#bib.bib21), 22 (https://arxiv.org/html/2608.13628#bib.bib22)\]。最初为递归核自适应滤波开发,后来扩展到复数域学习\[23 (https://arxiv.org/html/2608.13628#bib.bib23)\],它具有广泛的适用性。此外,一种基于核的RVFL模型(KERVFL)避免了显式隐藏层大小的选择\[24 (https://arxiv.org/html/2608.13628#bib.bib24)\]。然而,核方法存在计算成本高和可扩展性问题,并且将KRP集成到RVFL中仍未得到充分探索。
受传统RVFL网络在处理噪声、不平衡或损坏数据方面的局限性启发,我们提出了基于核风险敏感均值 p 幂的RVFL(KRPRVFL)模型,该模型将RVFL的效率与KRP准则的鲁棒性相结合。与依赖于最小二乘目标并对所有样本同等对待的标准RVFL不同,KRPRVFL采用基于KRP的风险敏感损失函数,在训练过程中自适应地抑制离群值和误标样本的影响。这确保了模型关注底层数据分布,从而在噪声环境中提高泛化和稳定性。此外,KRPRVFL集成了协作学习机制,使模型组件之间能够动态交互以细化预测并适应复杂的数据模式。通过利用核诱导的特征映射,KRPRVFL捕获输入空间中的非线性关系,无需手动选择隐藏层大小或复杂的迭代训练过程。提出的KRPRVFL模型为分类任务提供了一个快速、可扩展且鲁棒的框架,有效地结合了RVFL的计算简单性和基于核的风险敏感学习的弹性与适应性。本文的关键亮点可概括如下:

1.  所提出的KRPRVFL模型结合了RVFL网络快速轻量的架构与鲁棒的核风险敏感均值 p 幂(KRP)准则,能够有效处理噪声、损坏和不平衡的数据。
2.  通过用基于KRP的损失替代传统的最小二乘目标,该模型自适应地抑制离群值和误标样本的影响,在具有挑战性的学习条件下提高泛化能力和稳定性。
3.  KRPRVFL使用协作学习和核映射来捕获非线性关系,无需设置隐藏层大小即可提高准确性和鲁棒性。
4.  在UCI和KEEL基准数据集上的大量实验表明,所提出的KRPRVFL在准确率和统计显著性方面始终优于基线模型。

## II 相关工作
本节首先建立全文使用的符号表示,然后概述RVFL模型。

### II-A 符号
设训练数据集表示为 \(\mathcal{X} = \{(x_i, y_i) \mid i=1,2,\dots,n\}\),其中 \(x_i \in \mathbb{R}^{1 \times m}\) 表示输入特征向量,\(y_i \in \{+1, -1\}\) 是对应的目标标签。\(n\) 是训练样本总数,\(m\) 是特征数量。转置算子用 \((\cdot)^T\) 表示。所有输入和输出样本的矩阵分别定义为 \(X = [x_1^T, x_2^T, \dots, x_n^T]^T\) 和 \(Y = [y_1^T, y_2^T, \dots, y_n^T]^T\)。

### II-B 随机向量泛函链接(RVFL)网络
RVFL网络是一个单层前馈网络,具有随机且固定的输入到隐藏层权重,以及从输入到输出的跳跃连接,增强了泛化能力。具有 \(N\) 个隐藏节点的隐藏层输出矩阵 \(H_1 \in \mathbb{R}^{n \times N}\) 计算如下:
\[ H_1 = \phi(XW_1 + b_1), \]
其中 \(W_1 \in \mathbb{R}^{m \times N}\) 是随机初始化的权重矩阵,\(b_1 \in \mathbb{R}^{n \times N}\) 是偏置矩阵,\(\phi\) 是激活函数。
组合特征矩阵 \(H_2\) 拼接了输入和隐藏层输出,定义为 \(H_2 = [X; H_1]\)。预测输出 \(\hat{Y}\) 由下式给出:
\[ H_2 \beta = \hat{Y}, \]
其中 \(\beta \in \mathbb{R}^{(m+N) \times 1}\) 表示输出权重矩阵。训练RVFL涉及求解以下正则化最小二乘优化问题:
\[ \beta_{\min} = \arg\min_{\beta} \frac{\mathcal{C}}{2} \|H_2\beta - Y\|^2 + \frac{1}{2} \|\beta\|^2, \]
其中 \(\mathcal{C} > 0\) 是正则化参数。对于 \(\beta\) 的封闭形式解取决于 \(H_2\) 相对于样本数 \(n\) 的维度:
\[ \beta_{\min} = \begin{cases} H_2^T(H_2 H_2^T + \frac{1}{\mathcal{C}} I)^{-1}Y, & n < (m+N) \\ (H_2^T H_2 + \frac{1}{\mathcal{C}} I)^{-1} H_2^T Y, & n \ge (m+N) \end{cases} \]

### II-C 核风险敏感均值 p 幂(KRP)准则
KRP准则最初用于评估两个样本序列 \(\alpha\) 和 \(\beta\) 在再生核希尔伯特空间中的相似性,其定义为:
\[ \mathcal{L}_{\mu, p}(\alpha, \beta) = \frac{1}{n^\mu} \sum_{i=1}^n \exp\left( \mu (1 - \kappa(\alpha_i, \beta_i))^p \right), \]
其中 \(\mu > 0\) 调节损失函数中的风险敏感程度,\(p > 0\) 决定偏差惩罚的阶数。在本工作中,核映射使用高斯Mercer核实例化,带宽参数 \(\sigma > 0\),定义为:
\[ \kappa_{\sigma}(\alpha, \beta) = \exp\left( -\frac{(\alpha - \beta)^2}{2\sigma^2} \right). \]
\((\alpha, \beta)\) 的联合概率分布通常无法获取。相反,只观察到有限的 \(n\) 个配对样本 \((\alpha_i, \beta_i)_{i=1}^n\)。使用经验近似,KRP准则表述为:
\[ \mathcal{L}_{\mu, p, \sigma}(\alpha, \beta) = \frac{1}{n\mu} \sum_{i=1}^n \exp\left( \mu \left(1 - \kappa_{\sigma}(\alpha_i, \beta_i)\right)^{p/2} \right). \]
从这个角度看,KRP准则可以被解释为在核诱导的特征空间中两个样本序列 \([\alpha_1, \alpha_2, \dots, \alpha_n]\) 和 \([\beta_1, \beta_2, \dots, \beta_n]\) 之间的相似性评估机制。学习任务旨在最小化真实标签矩阵 \(Y\) 和RVFL输出之间的经验KRP损失,可表示为:
\[ \mathcal{L}_{\mu, p, \sigma}(Y, HW) = \underset{W}{\arg\min} \sum_{i=1}^n \exp\left( \mu \left(1 - \kappa_{\sigma}(y_i, \hat{y}_i)\right)^{p/2} \right), \]
其中 \(y_i\) 和 \(\hat{y}_i\) 分别表示第 \(i\) 个样本 \(x_i\) 的真实标签和预测输出。预测输出 \(\hat{y}_i\) 由RVFL模型得出:
\[ \hat{y}_i = h_i W, \]
其中 \(h_i \in \mathbb{R}^N\) 表示RVFL隐藏层特征矩阵的第 \(i\) 行,\(W\) 表示输出权重矩阵。为了进一步控制模型复杂度并防止过拟合,目标函数中加入了一个正则化项。因此,所提出的KRPRVFL模型的最终优化问题表述为:
\[ \underset{W}{\arg\min} \left( \mathcal{D} \|W\|^2 + \frac{1}{n\mu} \sum_{i=1}^n \left( \mu \left(1 - \kappa_{\sigma}(y_i, h_i W)\right)^{p/2} \right) \right). \]
为简化后续推导,将整体目标函数记为 \(\psi(W)\),定义为
\[ \psi(W) = \mathcal{D} \|W\|^2 + \frac{1}{n\mu} \sum_{i=1}^n \exp\left( \mu \left(1 - \kappa_{\sigma}(y_i, h_i W)\right)^{[p/2]} \right). \]
为方便起见,我们进一步引入辅助变量 \(\upsilon_i = 1 - \kappa_{\sigma}(y_i, h_i W)\),它表征了第 \(i\) 个样本的真实标签与预测输出之间的基于核的偏差。根据此定义,\(\psi(W)\) 关于输出权重矩阵 \(W\) 的梯度可推导如下:
\[ \frac{\partial \psi(W)}{\partial W} = 2\mathcal{D}W - \frac{p}{2n\sigma^2} H^T \Omega (Y - HW), \]
其中 \(\Omega \in \mathbb{R}^{n \times n}\) 表示一个对角加权矩阵,其定义为 \(\Omega = \text{diag}(\omega_1, \omega_2, \dots, \omega_n)\),且 \(\omega_i = \exp\left( \mu (1 - \kappa_{\sigma}(y_i, h_i W))^{p/2} \right)\)。

相似文章

Uncertainty-Aware Ensemble Deep Randomized Neural Networks for Classification

arXiv cs.LG

The paper proposes intuitionistic fuzzy deep RVFL (IF-dRVFL) and ensemble deep RVFL (IF-edRVFL) frameworks that use sample neighborhood information to improve robustness against noise and outliers in classification tasks, outperforming existing SOTA fuzzy and non-fuzzy approaches on benchmark datasets.

面向多模态情感-原因配对提取的鲁棒配对置信度学习

arXiv cs.CL

本文介绍了RPCL,一种仅用于训练阶段的鲁棒配对置信度学习框架,用于多模态情感-原因配对提取。该框架改进了黄金配对与困难负例之间的判别性分离,并在三个数据集上的Pair F1和AUPRC指标上取得了显著提升。