基于非对称RoBoSS损失函数的稀疏鲁棒几何孪生支持向量机

arXiv cs.LG 论文

摘要

本文提出一种新的非对称鲁棒有界稀疏平滑(aR)损失函数,用于l1范数惩罚的几何孪生支持向量机(aRSGTSVM),以处理带有标签噪声和特征噪声的分类与回归任务,实现特征选择并提高鲁棒性。在合成数据集、UCI数据集以及中国股市指数跟踪上的实验表明了其优越性。

arXiv:2608.11567v1 公告类型:新 摘要:在现实场景中,训练数据通常包含冗余特征、标签噪声和特征噪声,这对机器学习方法的效率提出了严峻挑战。由于标准支持向量机(SVM)采用$l_2$范数惩罚和合页损失函数,它缺乏选择重要特征的能力,并且对噪声敏感。为了解决这些问题,本文提出一种新颖的非对称、鲁棒、有界、稀疏且平滑的(aR)损失函数,用于$l_1$范数惩罚的几何孪生SVM(aRSGTSVM),以处理分类和回归任务。$l_1$范数惩罚可以实现特征选择。所提出的aR损失函数不仅能有效减轻标签噪声的影响,还能显著增强对重采样噪声(即边界超平面附近的零均值特征噪声)的稳定性。此外,还利用影响函数对aRSGTSVM的鲁棒性进行了统计分析。由于aRSGTSVM涉及非凸非光滑优化问题,我们开发了一种快速且稳定的基于近端梯度的求解算法。与相关的最新方法相比,实验结果表明,所提出的aRSGTSVM在合成数据集和UCI数据集上均具有优越性。此外,我们将aRSGTSVM应用于指数跟踪任务,在中国股市不同指数跟踪的结果表明其能够取得令人满意的性能。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:37

# 基于非对称 RoBoSS 损失函数的稀疏鲁棒几何孪生支持向量机
来源:https://arxiv.org/html/2608.11567  
Kai Qi  
电子邮箱:[[email protected]](mailto:[email protected])  
地址:国家应用数学中心(重庆),重庆师范大学,重庆,401331,中国。

Xinji Huang  
电子邮箱:[[email protected]](mailto:[email protected])  
地址:重庆师范大学数学科学学院,重庆,401331,中国。

Hongchun Wang  
通讯作者:*  
电子邮箱:[[email protected]](mailto:[email protected])  
地址:重庆师范大学数学科学学院,重庆,401331,中国。

###### 摘要
在现实场景中,训练数据通常包含冗余特征、标签噪声和特征噪声,这给机器学习方法的效率带来了严峻挑战。由于标准支持向量机(SVM)采用 $l_2$ 范数惩罚和铰链损失函数,它缺乏选择重要特征的能力,并且对噪声敏感。为了解决这些问题,本文提出了一种新的非对称、鲁棒、有界、稀疏且光滑的(aR)损失函数,用于 $l_1$ 范数惩罚的几何孪生支持向量机(aRSGTSVM),以处理分类和回归任务。$l_1$ 范数惩罚可以实现特征选择。所提出的 aR 损失函数不仅能有效减轻标签噪声的影响,还能显著增强对重采样噪声(即边界超平面附近的零均值特征噪声)的稳定性。此外,本文还利用影响函数对 aRSGTSVM 的鲁棒性进行了统计分析。由于 aRSGTSVM 涉及非凸和非光滑优化,我们开发了一种快速稳定的基于近端梯度下降的求解算法。与相关的最新方法相比,实验结果表明所提出的 aRSGTSVM 在合成数据集和 UCI 数据集上均具有优越性。此外,我们将 aRSGTSVM 应用于指数跟踪任务,对中国股市不同指数的跟踪结果表明,该方法能够取得令人满意的性能。

###### 关键词:
特征选择,鲁棒性,几何孪生分类与回归,非对称 RoBoSS 损失函数,非凸非光滑优化

## 1 引言
孪生支持向量机(TSVM)[Jayadeva et al. 2007](https://arxiv.org/html/2608.11567#bib.bib1) 是支持向量机最著名的变体之一,在过去十年中经历了蓬勃发展,并已广泛应用于不同领域,如数字识别 [Chen et al. 2011](https://arxiv.org/html/2608.11567#bib.bib2)、医学诊断 [Qi and Yang 2022](https://arxiv.org/html/2608.11567#bib.bib3)、[Liang and Ding 2024](https://arxiv.org/html/2608.11567#bib.bib4) 和生物分析 [Quadir et al. 2025](https://arxiv.org/html/2608.11567#bib.bib5)。从几何角度来看,TSVM 旨在寻找一对非平行的分离超平面,其中每个超平面要求靠近一类样本,同时远离另一类样本。这使得 TSVM 比标准 SVM 更加灵活和高效。此外,与 SVM 类似,标准 TSVM 也可以从统计的角度进行解释,即它符合“损失 + 惩罚”的正则化框架 [Shao et al. 2011](https://arxiv.org/html/2608.11567#bib.bib6)、[Qi and Yang 2022](https://arxiv.org/html/2608.11567#bib.bib3)。具体来说,大多数现有的 TSVM 采用铰链损失和 $l_2$ 范数惩罚。然而,铰链损失被证明对标签噪声 [Wu and Liu 2007](https://arxiv.org/html/2608.11567#bib.bib7)、[Wang et al. 2024](https://arxiv.org/html/2608.11567#bib.bib8) 和重采样噪声(边界超平面附近的零均值特征噪声)[Huang et al. 2014](https://arxiv.org/html/2608.11567#bib.bib9) 敏感。$l_2$ 范数惩罚缺乏执行特征选择的能力 [Zhu et al. 2004](https://arxiv.org/html/2608.11567#bib.bib10)、[Wang et al. 2006](https://arxiv.org/html/2608.11567#bib.bib11)。因此,在处理复杂的现实世界问题时,TSVM 的效率仍有很大的提升空间。

SVM 和 TSVM 对标签噪声的敏感性主要源于铰链损失的无上界性。具体而言,标签噪声通常位于分离超平面附近,甚至位于错误的一侧。对于这类样本,由于铰链损失函数的无界性,损失可能相当大。因此,通过最小化优化目标,最终获得的分离超平面往往会受到标签噪声的偏移。为了解决这个问题,研究人员转向非凸损失函数来增强对标签噪声的鲁棒性。通过考虑逻辑损失及其平移版本之间的差异,Krause 和 Singer [Krause and Singer 2004](https://arxiv.org/html/2608.11567#bib.bib12) 提出了逻辑差分(LD)损失,用于 SVM 以减少标签噪声的影响。Wu 和 Liu [Wu and Liu 2007](https://arxiv.org/html/2608.11567#bib.bib7) 将截断铰链损失(即所谓的斜坡损失)与 SVM 集成以增强鲁棒性。后来,Liu 等人 [Liu et al. 2015](https://arxiv.org/html/2608.11567#bib.bib13) 将斜坡损失与 TSVM 相结合,提出了鲁棒非平行 SVM(RNPSVM)。Wang 等人 [Wang et al. 2019](https://arxiv.org/html/2608.11567#bib.bib14) 构建了截断 $l_1$ 范数损失用于鲁棒 TSVM。Wang 等人 [Wang et al. 2024](https://arxiv.org/html/2608.11567#bib.bib8) 设计了一种新的截断平方损失以获得鲁棒 SVM($L_{tsl}$-SVM)。除了截断之外,相关熵也是设计鲁棒损失的有效方法 [Liu et al. 2007](https://arxiv.org/html/2608.11567#bib.bib15)、[Singh et al. 2014](https://arxiv.org/html/2608.11567#bib.bib16)。Xu 等人 [Xu et al. 2017](https://arxiv.org/html/2608.11567#bib.bib17) 将相关熵的思想发展到 SVM,并提出了重新缩放铰链损失 SVM,该算法可以减轻异常值的干扰。Xu 等人 [Xu et al. 2018](https://arxiv.org/html/2608.11567#bib.bib18) 研究了基于相关熵的损失(C-loss)用于最小二乘 SVM。Ma 等人 [Ma et al. 2021](https://arxiv.org/html/2608.11567#bib.bib19) 构建了一种源自相关熵的新型自适应截断损失,以增强 TSVM 对标签噪声的抵抗能力。最近,Akhtar 等人 [Akhtar et al. 2025](https://arxiv.org/html/2608.11567#bib.bib20) 为 SVM 引入了一种新颖的鲁棒、有界、稀疏且光滑(RoBoSS)损失函数,以减轻标签噪声的影响。然而,RoBoSS 损失忽略了重采样噪声的扰动,其性能仍需进一步提高。

关于重采样噪声,Huang 等人 [Huang et al. 2014](https://arxiv.org/html/2608.11567#bib.bib9) 首先证明了基于铰链损失的分离超平面对边界附近的零均值特征噪声敏感。因此,从重采样过程(如 $K$ 折交叉验证)中获得的解决方案缺乏稳定性。受统计分位数的启发,他们将弹球损失引入 SVM(PinSVM)以增强其重采样稳定性。作者 [Huang et al. 2014](https://arxiv.org/html/2608.11567#bib.bib21) 进一步将该思想扩展到平方损失,开发了一种具有光滑且易于优化的目标函数的非对称最小二乘 SVM。PinSVM 的一个关键局限性是丧失了样本稀疏性。具体而言,所有训练样本都成为支持向量。这一缺点会增加训练负担 [Huang et al. 2014](https://arxiv.org/html/2608.11567#bib.bib9)。为了促进稀疏性,Shen 等人 [Shen et al. 2017](https://arxiv.org/html/2608.11567#bib.bib22) 提出了一种截断弹球损失,它可以在稀疏性和特征噪声不敏感性之间提供灵活的权衡。受分位数和相关熵的启发,Yang 和 Dong [Yang and Dong 2019](https://arxiv.org/html/2608.11567#bib.bib23) 提出了一种广义分位数损失。基于最小二乘 SVM,He 等人 [He et al. 2023](https://arxiv.org/html/2608.11567#bib.bib24) 建立了一种非对称核学习分类器。

对于冗余特征,它们常常为建模过程提供不相关甚至误导性的信息。因此,预测性能可能会下降。Zhu 等人 [Zhu et al. 2004](https://arxiv.org/html/2608.11567#bib.bib10) 用 $l_1$ 范数惩罚代替 $l_2$ 范数惩罚,提出了 1 范数 SVM,它可以同时选择重要特征并去除冗余特征。Ikeda 和 Murata [Ikeda and Murata 2005](https://arxiv.org/html/2608.11567#bib.bib25) 研究了 $l_p$ 范数惩罚的 $\nu$-SVM 的几何性质,其中 $1 \leq p \leq \infty$。Zhu 等人 [Wang et al. 2006](https://arxiv.org/html/2608.11567#bib.bib11) 将弹性网络与 SVM 集成,构建了双重正则化 SVM(DrSVM)。在许多现实场景中,输入特征具有分组结构。因此,在组级别而非单个特征级别执行特征选择或消除更为重要。为了实现组选择,Zou 和 Yuan [Zou and Yuan 2008](https://arxiv.org/html/2608.11567#bib.bib26) 对每组特征应用无穷范数,提出了 $F_\infty$ 范数 SVM。Gao 等人 [Gao et al. 2011](https://arxiv.org/html/2608.11567#bib.bib27) 对最小二乘 TSVM 采用 $l_1$ 范数惩罚,以自动选择输入特征。Moosaei 和 Hladík [Moosaei and Hladík 2023](https://arxiv.org/html/2608.11567#bib.bib28) 提出了用于 TSVM 的 $l_p$ 范数($0 < p < 1$)惩罚,以同时实现特征选择并增强鲁棒性。

另一方面,除了分类之外,回归也是机器学习中的核心任务,而孪生支持向量回归(TSVR)[Peng 2010](https://arxiv.org/html/2608.11567#bib.bib29) 是 TSVM 的经典回归变体。与 TSVM 类似,TSVR 也可以从“损失 + 惩罚”的视角进行解释 [Qi and Yang 2022](https://arxiv.org/html/2608.11567#bib.bib3)。然而,TSVR 通常采用 $l_2$ 范数惩罚和 $ε$ 不敏感损失,也会面临类似的问题。例如,它可能无法有效处理含噪或冗余特征的数据。

为了解决上述问题,并增强对标签噪声和重采样噪声的鲁棒性,本文提出了一种非对称 RoBoSS(aR)损失函数。基于该损失函数,我们构建了 $l_1$ 范数惩罚的几何孪生支持向量机(aRSGTSVM)和几何孪生支持向量回归(aRSGTSVR)。本文的主要贡献总结如下:

1. 提出了 aR 损失函数,并分析了其理论性质,表明该损失是光滑、有界的,并且对标签噪声具有鲁棒性。通过引入非对称参数 $\tau$,aR 损失可以增强对重采样噪声的稳定性,与现有损失函数相比具有更大的灵活性。

2. 将 aR 损失与 $l_1$ 范数惩罚相结合,提出了用于分类的 aRSGTSVM 和用于回归的 aRSGTSVR 模型。与 $l_2$ 范数惩罚相比,$l_1$ 范数惩罚有利于特征选择,从而减少冗余特征的影响。

3. 由于所提出的模型涉及非凸非光滑优化问题,我们开发了一种基于近端梯度下降的求解算法。该算法通过计算近似梯度并利用近端算子处理 $l_1$ 范数惩罚项,保证收敛性和稳定性。

4. 在合成数据集、UCI 基准数据集以及中国股市指数跟踪任务上进行了大量实验。实验结果表明,所提出的 aRSGTSVM/aRSGTSVR 在分类准确率、回归精度和特征选择效率方面均优于同类方法。

本文的其余部分组织如下。第 2 节简要介绍 RoBoSS 损失。第 3 节详细介绍所提出的 aR 损失、aRSGTSVM 和 aRSGTSVR 模型及其优化算法。第 4 节通过实验验证所提出方法的有效性。第 5 节总结全文。

## 2 相关工作

在本节中,我们简要回顾 RoBoSS 损失函数及其 SVM 模型。RoBoSS 损失是由 Akhtar 等人 [Akhtar et al. 2025](https://arxiv.org/html/2608.11567#bib.bib20) 提出的,定义为:

$$
L_{RoBoSS}(u)=
\begin{cases}
\lambda\left(1-(au+1)\exp(-au)\right), & u>0,\\
0, & u\leq 0,
\end{cases}
$$

(3)

其中 $a$ 是形状参数,$\lambda$ 是边界参数。RoBoSS-SVM 的原问题可以表述为:

$$
\min_{w,b}\frac{1}{2}\|w\|^2+\frac{C}{n}\sum_{i=1}^{n}L_{\text{RoBoSS}}\left(1-y_i\left(w^T x_i+b\right)\right).
$$

(4)

其中 $w$ 和 $b$ 分别是分离超平面的法向量和截距,$C>0$ 是调整参数。

## 3 提出的 aRSGTSVM

正如前面所讨论的,尽管 RoBoSS 损失对噪声具有鲁棒性,但它对重采样表现出不稳定性。在本章中,我们提出了一种非对称版本的 RoBoSS 损失,称为 aR 损失,以处理高维学习中更复杂的噪声。具体来说,[第 3.1 节](#S3.SS1) 介绍了 aR 损失并研究了其理论性质。[第 3.2 节](#S3.SS2) 针对分类问题提出了 aRSGTSVM 方法,而 [第 3.3 节](#S3.SS3) 针对回归场景提出了 aRSGTSVR 模型。最后,[第 3.4 节](#S3.SS4) 给出了相应的优化算法。

### 3.1 非对称 RoBoSS 损失

尽管 RoBoSS 损失对标签噪声表现出相当大的鲁棒性,但 Huang 等人 [Xu et al. 2017](https://arxiv.org/html/2608.11567#bib.bib31) 指出,在许多实际问题中,除了异常值之外,高维复杂数据还可能受到其他类型噪声的影响,例如重采样噪声或边界超平面附近的零均值噪声。然而,诸如铰链损失和 RoBoSS 损失等单边损失函数难以有效减轻此类噪声的影响,导致模型性能不稳定,仍有改进空间。因此,为了进一步增强 RoBoSS 损失处理复杂数据的能力,我们提出了一种新的损失函数,称为 aR,其定义如下:

$$
L_{aR}(u)=
\begin{cases}
\lambda\left(1-(au+1)\exp(-au)\right), & u>0,\\
\tau\lambda\left(1-(au^2+1)\exp(-au^2)\right), & u\leq 0,
\end{cases}
$$

(5)

其中形状参数 $a>0$,间隔参数 $\lambda>0$,参数 $\tau \in [0,1]$ 控制损失函数的非对称性,从而增强模型对重采样噪声的鲁棒性。接下来,我们将详细阐述所提出的 aR 损失函数的性质。

**性质 1.** aR 损失函数是 $C^1$ 光滑的。

**证明.** 首先,由 (5) 可得:

$$
\nabla L_{aR}(u)=
\begin{cases}
\lambda a^2 u \exp(-au), & u>0,\\
2\tau\lambda a^2 u^3 \exp(-au^2), & u\leq 0,
\end{cases}
$$

(6)

因此,我们可以推导出 $\nabla L_{aR}(0^+)=0$ 且 $\nabla L_{aR}(0^-)=0$。根据 (5),我们有 $\lim_{u\to 0^+}L_{aR}(u)=\lim_{u\to 0^-}L_{aR}(u)=L_{aR}(0)=0$,这意味着 $L_{aR}(u)$ 在 $u=0$ 处连续。因此,aR 损失是一个 $C^1$ 光滑函数。$\square$

**性质 2.** aR 损失函数是有界的。

**证明.** 对于 $u>0$,有 $\nabla L_{aR}(u)=\lambda a^2 u \exp(-au)>0$,这意味着 $L_{aR}(u)$ 在 $(0,+\infty)$ 上严格单调递增。对于 $u<0$,有 $\nabla L_{aR}(u)=2\tau\lambda a^2 u^3 \exp(-au^2)<0$,这意味着 $L_{aR}(u)$ 在 $(-\infty,0)$ 上严格单调递减。根据上述单调性,函数在 $u=0$ 处达到全局最小值,且 $L_{aR}(0)=0$,这意味着损失函数的下界为 0。接下来,我们通过计算无穷远处的极限来分析函数的上界:

$$
\lim_{u\to+\infty}L_{aR}(u)=\lambda,\quad \lim_{u\to-\infty}L_{aR}(u)=\tau\lambda.
$$

(7)

由于 $0<\tau\leq 1$,我们有 $\tau\lambda\leq\lambda$。结合两个区间上的单调性,所有函数值满足 $0\leq L_{aR}(u)\leq\lambda,\quad \forall u\in\mathbb{R}.$ (8) 因此,aR 损失函数既有下界又有上界,即它在 $\mathbb{R}$ 上是有界的。$\square$

**性质 3.** aR 损失对标签噪声(异常值)具有鲁棒性,这可以通过影响函数从理论上得到保证。

**证明.** Hampel 引入了影响函数 [Hampel 1968](https://arxiv.org/html/2608.11567#bib.bib32),主要用于衡量估计器在受到无穷小污染时的稳定性。对于理想的鲁棒损失函数,其诱导估计器的影响函数是有界的。根据 [Akhtar et al. 2026](https://arxiv.org/html/2608.11567#bib.bib33) 以及 (6),我们有 $\nabla l_{aR}$ 在 $u=\frac{1}{a}$ 处(对于 $u>0$)达到最大值,而在 $u=-\sqrt{\frac{3}{2a}}$ 处(对于 $u\leq 0$)达到最大值。因此,可得:

$$
|\text{IF}(u)|\leq \max\left(\frac{\lambda a}{e},\frac{3\tau\lambda\sqrt{6a}}{2e^{3/2}}\right)<\infty,\quad \forall u\in\mathbb{R}.
$$

(9)

因此,根据影响函数理论,对于基于 aR 损失设计的 SVM 模型,即使由标签噪声引起的损失 $u$ 极大,它们对模型的影响仍然是有限的。这从理论上保证了 aR 损失的鲁棒性。图 1 展示了在不同参数下 aR 损失函数的多种形式。结合前述命题,非对称 aR 损失...

相似文章

用于回归的鲁棒XGBoosting

arXiv cs.LG

本文研究了XGBoost在回归任务中对异常值的敏感性,并引入了基于M-、S-和τ-估计器的鲁棒损失函数,提出了MM-XGBoost以在鲁棒性和预测精度之间实现更好的权衡。

面向低维结构学习的鲁棒子空间约束二次模型

arXiv cs.LG

本文提出了一种鲁棒的子空间约束二次模型,用于从高维数据中学习低维结构,能够适应重尾噪声。我们开发了一种带有回溯线搜索的梯度算法,实验表明该方法在鲁棒性和重建精度上均有所提升。