面向纵向分布式弹性网络支持向量机的数据驱动弹球损失选择
摘要
本文提出了一种数据驱动的弹性网络支持向量机,它在候选弹球损失上学习单纯形约束权重,同时保留一个分类器。该加权损失等价于具有数据依赖有效参数的弹球损失。经验预言不等式表明,当权重正则化和单纯形截断消失时,全局最小化处的分类器目标不会超过最佳固定候选的目标;否则,超出部分被显式界定。针对高维数据,我们开发了一种列划分变量分裂求解器。它以最佳迭代的 $O(1/T)$ 平方步长残差率收敛。在共同初始化和全局参数下,任何列划分在精确算术下都会产生与集中训练相同的迭代和求解结果。实验评估了预测行为、数值等价性和多进程可扩展性。
查看缓存全文
缓存时间: 2026/08/04 07:44
# 面向垂直分布式弹性网络SVM的数据驱动弹球损失选择
Source: https://arxiv.org/html/2608.00949
Kai Qi222These authors contributed equally to this work\. Rongmei LiangYunnan Key Laboratory of Statistical Modeling and Data Analysis, School of Mathematics and Statistics, Yunnan University, East Outer Ring South Road, University Town, Chenggong District, Kunming, Yunnan, ChinaNational Center for Applied Mathematics in Chongqing, Chongqing Normal University, No\. 37 University Town Middle Road, Shapingba District, Chongqing, ChinaDepartment of Statistics and Data Science, Southern University of Science and Technology, 1088 Xueyuan Avenue, Nanshan District, Shenzhen, Guangdong 518055, China
###### 摘要
弹球损失支持向量机具有鲁棒性,但其非对称参数通常需要预先固定。我们提出了一种数据驱动的弹性网络支持向量机,它在保留单一分类器的同时,学习候选弹球损失上的单纯形约束权重。该加权损失等价于具有数据相关有效参数的单一弹球损失。经验Oracle不等式表明,当权重正则化和单纯形截断趋于零时,全局最小化处的分类器目标不超过最佳固定候选目标;否则,超出部分有显式界限。针对高维数据,我们开发了一种按列划分的变量分裂求解器。其迭代以最佳迭代O(1/T)O(1/T)平方步长残差速率收敛。在相同初始化和全局参数下,任意列划分在精确算术意义下都会产生与集中式训练相同的迭代序列和解。实验评估了预测行为、数值等价性和多进程可扩展性。
###### 关键词:
数据驱动参数选择, 垂直划分数据, 特征分裂, 分布式优化
††journal:Pattern Recognition
## 1 引言
考虑一个二分类训练样本\{\(xi,yi\)\}i=1n\\\{\(\\bm\{x\}\_\{i\},y\_\{i\}\)\\\}\_\{i=1\}^\{n\},其中nnsample size是样本量,xi∈Rp\\bm\{x\}\_\{i\}\\in\\mathbb\{R\}^\{p\}是观测ii的pp维特征向量,yi∈\{−1,1\}y\_\{i\}\\in\\\{\-1,1\\\}是其类别标签。对于一般输入x∈Rp\\bm\{x\}\\in\\mathbb\{R\}^\{p\},正则化支持向量机估计
f\(x\)=⟨w,φ\(x\)⟩H\+b,f\(\\bm\{x\}\)=\\langle\\bm\{w\},\\phi\(\\bm\{x\}\)\\rangle\_\{\\mathcal\{H\}\}\+b,其中ff是决策函数,φ:Rp→H\\phi:\\mathbb\{R\}^\{p\}\\to\\mathcal\{H\}是特征映射,H\\mathcal\{H\}是诱导特征空间,⟨⋅,⋅⟩H\\langle\\cdot,\\cdot\\rangle\_\{\\mathcal\{H\}\}是其内积,w∈H\\bm\{w\}\\in\\mathcal\{H\}是系数元素,b∈Rb\\in\\mathbb\{R\}是截距。恒等映射给出线性模型,而核诱导映射给出非线性模型。由于本研究面向高维、通常稀疏的数据,我们聚焦于线性SVM,它提供可扩展的训练、可解释的系数,以及弹性网络正则化和垂直特征分裂的自然基础\[1 (https://arxiv.org/html/2608.00949#bib.bib1),2 (https://arxiv.org/html/2608.00949#bib.bib2),3 (https://arxiv.org/html/2608.00949#bib.bib3)\]。因此,在本文其余部分,φ\(x\)=x\\phi\(\\bm\{x\}\)=\\bm\{x\}。
在这一线性框架内,拟合分类器由边际损失和正则化器共同决定。合页损失计算方便,但其影响模式固定\[4 (https://arxiv.org/html/2608.00949#bib.bib4)\]。弹球损失引入了非对称参数τ∈\[0,1\]\\tau\\in\[0,1\],可在保持凸性的同时提高鲁棒性\[5 (https://arxiv.org/html/2608.00949#bib.bib5)\],而弹性网络正则化则促进稀疏性并稳定相关特征\[6 (https://arxiv.org/html/2608.00949#bib.bib6),7 (https://arxiv.org/html/2608.00949#bib.bib7)\]。将这些组件结合起来在高维问题中尤其有吸引力,因为此时特征数量可能与样本量相当或远大于样本量。随着特征维度的增长,在单台机器上存储完整设计矩阵并反复计算全局矩阵–向量乘积可能变得不切实际。当特征块由不同站点自然持有或超过单机内存时,按列划分因此成为一种实际需求,而不仅仅是实现选择。这些考虑引出了两个相互关联的问题:如何从数据中选择τ\\tau,以及当特征按列划分时,如何高效且精确地训练所得模型。
第一个问题涉及τ\\tau的数据驱动选择。传统网格搜索对每个候选值拟合一个独立模型,最终只返回一个离散选择。我们改为在共享一个分类器和一个残差向量r=\(r1,...,rn\)⊤∈Rn\\bm\{r\}=\(r\_\{1\},\\ldots,r\_\{n\}\)^\{\\top\}\\in\\mathbb\{R\}^\{n\}(其第ii个分量为观测ii的边际残差)的同时,学习有限归一化弹球损失族上的单纯形权重。该加权族精确等价于具有数据相关有效参数的单一归一化弹球损失。这种表示还产生了直接的Oracle比较。具体而言,设γ≥0\\gamma\\geq 0表示二次权重惩罚的系数,ε≥0\\varepsilon\\geq 0表示施加于每个单纯形权重的下界。当γ=ε=0\\gamma=\\varepsilon=0时,在任何全局最小化处,经验分类器目标不超过最佳固定候选目标;否则,超出部分由显式的权重正则化和单纯形截断项控制。
第二个问题涉及垂直划分高维数据的计算。设X∈Rn×p\\bm\{X\}\\in\\mathbb\{R\}^\{n\\times p\}为设计矩阵,y=\(y1,...,yn\)⊤∈Rn\\bm\{y\}=\(y\_\{1\},\\ldots,y\_\{n\}\)^\{\\top\}\\in\\mathbb\{R\}^\{n\}为标签向量,w∈Rp\\bm\{w\}\\in\\mathbb\{R\}^\{p\}为线性系数向量。X\\bm\{X\}的特征列和w\\bm\{w\}的对应块分布在MM个工作节点上,其中MM是拥有特征的站点数量,而协调器维护共享截距和逐样本变量。通过仅交换部分边际,所提出的变量分裂算法在精确算术意义下,在保持初始化和全局算法参数固定的条件下,能够重现任意列划分下的集中式迭代序列和解\[8 (https://arxiv.org/html/2608.00949#bib.bib8),9 (https://arxiv.org/html/2608.00949#bib.bib9)\]。
为共同解决这两个问题,本文做出两项贡献。
1. \(1\)我们提出了一种共享分类器弹性网络SVM,它在归一化弹球损失候选上学习单纯形权重。加权损失具有精确的数据相关有效参数。经验Oracle不等式表明,当权重正则化和单纯形截断消失时,全局最小化处的分类器目标不超过最佳固定τ\\tau候选目标;否则,超出部分有显式界限。
2. \(2\)我们开发了一种按列划分的变量分裂算法,它分布特征块和系数块,同时从局部贡献重构全局边际。内层求解器以最佳迭代O\(1/T\)O\(1/T\)平方步长残差速率收敛,并且对列划分不敏感:在共同初始化和全局参数下,每个划分在精确算术意义下都重现集中式迭代序列和解。
本文其余部分组织如下。第2节回顾鲁棒SVM损失、数据驱动损失加权和垂直特征划分。第3节介绍共享分类器损失加权模型及其有效参数表示。第4节开发垂直分布式求解器并分析其通信模式。第5节给出Oracle比较、下降、收敛和划分等价结果。第6节报告预测、参数选择、数值不变性和多进程实验。第7节总结全文,随附的补充材料提供详细证明和额外技术推导。本文的复现代码可在https://github.com/xfwu1016/DP-ENSVM下载。
## 2 相关工作
### 2\.1 弹球损失与弹性网络SVM
合页损失是凸的、分类校准的,并且兼容高效的大间隔优化,但其分段线性几何以相同斜率处理所有位于边际上或边际内的观测。鲁棒替代方案在保持凸性或计算可行性的同时修改这种影响模式。其中,弹球损失对边际残差两侧赋予不同斜率,并具有分位数导向的解释\[5 (https://arxiv.org/html/2608.00949#bib.bib5)\]。C-损失和重缩放合页损失提供了相关的鲁棒替代方案,重塑困难观测的影响\[10 (https://arxiv.org/html/2608.00949#bib.bib10),11 (https://arxiv.org/html/2608.00949#bib.bib11)\]。截断弹球损失在降低对特征噪声敏感性的同时恢复稀疏性\[12 (https://arxiv.org/html/2608.00949#bib.bib12)\],有界指数-分位数构造进一步控制极端观测的影响\[13 (https://arxiv.org/html/2608.00949#bib.bib13)\]。近期研究还开发了广义斜坡、有界平方和波损失,以及可扩展或平滑优化过程\[14 (https://arxiv.org/html/2608.00949#bib.bib14),15 (https://arxiv.org/html/2608.00949#bib.bib15),16 (https://arxiv.org/html/2608.00949#bib.bib16)\]。带有嵌入式弹性网络特征选择的鲁棒概率机器提供了对鲁棒性与稀疏性之间相互作用的补充视角\[17 (https://arxiv.org/html/2608.00949#bib.bib17)\]。这些方法丰富了可用的损失目录,但它们通常在模型拟合之前固定所选择的损失及其形状参数。本研究处理的是在有限归一化弹球损失族内进行数据驱动选择这一不同问题。
参数τ\\tau决定了经验损失的非对称几何,因此其作用不同于普通正则化参数。正则化控制模型复杂度、稀疏性和稳定性,而τ\\tau改变决策边际两侧残差的相对影响。因此,即使在相同正则化设置下,不同的τ\\tau值也可能导致不同的分类器。这激励我们显式学习候选权重并报告选择的τ^\\widehat\{\\tau\},而不是将τ\\tau视为不可见的数值设置。
弹性网络正则化将促进稀疏性的l1\\ell\_\{1\}绝对值惩罚与严格凸的平方l2\\ell\_\{2\}欧几里得惩罚相结合,在高维SVM中产生稀疏且稳定的斜率估计。由此产生的凸复合问题可通过近端点、原始–对偶和增广拉格朗日技术求解\[18 (https://arxiv.org/html/2608.00949#bib.bib18),19 (https://arxiv.org/html/2608.00949#bib.bib19),20 (https://arxiv.org/html/2608.00949#bib.bib20),21 (https://arxiv.org/html/2608.00949#bib.bib21)\]。Liang等人开发了用于弹性网络SVM(包括弹球损失模型)的线性化ADMM方法\[22 (https://arxiv.org/html/2608.00949#bib.bib22)\]。在垂直分布式公式中,斜率向量根据特征块划分,而SVM截距保持为协调器维护的单个标量。然而,\[22 (https://arxiv.org/html/2608.00949#bib.bib22)\]中的线性化ADMM并不能直接产生本文所需的特征块可分离更新和划分等价性质。
### 2\.2 数据驱动损失加权
学习候选结构的凸组合在核学习、基于图的学习和分类器集成中很常见。多核学习估计表示上的权重\[23 (https://arxiv.org/html/2608.00949#bib.bib23)\],而预测级集成组合已拟合的决策规则。集成流形正则化尤其相关,因为它学习候选图拉普拉斯算子上的单纯形权重,并在预测模型和结构权重之间交替\[24 (https://arxiv.org/html/2608.00949#bib.bib24)\]。对权重向量的二次惩罚防止不稳定的赢者通吃解,并允许多个候选保持活跃。
我们使用权重的方式不同于预测集成。候选是损失几何,而不是单独的决策函数。一个共享分类器产生一个边际残差,每个候选损失都在该相同残差上评估。由此产生的凸组合具有精确的有效τ\\tau表示。因此,权重总结了数据如何在候选损失族上分配支持;它们不对预测取平均,也不创建候选特定的分类器参数。
这一区别也将所提方法与普通网格搜索区分开来。网格搜索拟合独立模型,并使用验证性能做出离散决策。在这里,候选风险进入一个联合目标,权重从当前共享残差更新,有效参数在优化过程中变化。最终的离散值τ^\\widehat\{\\tau\}仅在加权过程稳定后才获得。
### 2\.3 垂直特征划分
垂直划分意味着各站点共享对齐的样本标识符,但拥有不相交的特征块。这不同于水平联邦学习——其中站点拥有具有共同特征模式的不同观测。近期联邦学习研究处理动态客户端异构性和个性化的图结构化信息交换\[25 (https://arxiv.org/html/2608.00949#bib.bib25),26 (https://arxiv.org/html/2608.00949#bib.bib26)\]。这些设置主要围绕分布式观测或客户端模型组织,而垂直学习必须从不相交的特征视图重构一个全局预测。带协调服务器的多方垂直框架和垂直特征选择方法都依赖于交换中间表示而非原始特征表\[27 (https://arxiv.org/html/2608.00949#bib.bib27),28 (https://arxiv.org/html/2608.00949#bib.bib28)\]。对于线性模型,全局边际可以特别透明地从局部贡献组装。VERTICOX在生存分析中展示了这一原理:每个机构在本地保留其协变量,计算中间得分,并将聚合量传递给服务器\[8 (https://arxiv.org/html/2608.00949#bib.bib8)\]。
同样的架构适用于共享SVM分类器。对于MM个特征站点,站点mm存储局部设计块Xm\\bm\{X\}\_\{m\}和系数块wm\\bm\{w\}\_\{m\},其中m=1,...,Mm=1,\\ldots,M。令Y=diag\(y\)\\bm\{Y\}=\\operatorname\{diag\}\(\\bm\{y\}\),站点计算hm=YXmwm\\bm\{h\}\_\{m\}=\\bm\{Y\}\\bm\{X\}\_\{m\}\\bm\{w\}\_\{m\}并将hm∈Rn\\bm\{h\}\_\{m\}\\in\\mathbb\{R\}^\{n\}返回给协调器。协调器形成∑mhm\\sum\_\{m\}\\bm\{h\}\_\{m\},更新公共残差和对偶向量,并维护标量截距bb。没有bmb\_\{m\},因为截距不与任何特征子集关联。
高维正则化模型的并行优化可以通过共识分解或直接特征分裂来组织。Wu等人开发了一个统一的c...相似文章
用于二维浅水方程的有限体积信息神经网络框架:崎岖的损失景观与数据指导的重要性
本文介绍了“数据引导的 FVM-PINN”框架,该框架利用有限体积损失来求解二维浅水方程,并证明稀疏数据指导对于防止网络在崎岖的损失景观中崩溃至关重要。
具有可学习损失平衡和迁移学习的物理信息神经网络
本文提出了一种自监督物理信息神经网络(PINN)框架,该框架通过可学习的混合神经元自适应地平衡基于物理和数据驱动的损失,并结合迁移学习以提高数据稀缺情况下的效率。该框架在仅有87个数据点的液态金属微型散热器CFD数据上进行了验证,误差低于8%。
基于非对称RoBoSS损失函数的稀疏鲁棒几何孪生支持向量机
本文提出一种新的非对称鲁棒有界稀疏平滑(aR)损失函数,用于l1范数惩罚的几何孪生支持向量机(aRSGTSVM),以处理带有标签噪声和特征噪声的分类与回归任务,实现特征选择并提高鲁棒性。在合成数据集、UCI数据集以及中国股市指数跟踪上的实验表明了其优越性。
从非凸自和谐正则化到可扩展的PINNs拟牛顿训练
本文提出了SCORE,一种受自和谐启发的拟牛顿方法,用于训练物理信息神经网络(PINNs)。它使用递减耦合的移位割线几何,在不需要计算Hessian矩阵的情况下,提高了非线性PDE基准测试的最终精度。
基于可微D-vine Copula的局部异常检测
提出了一种新颖的D-vine copula估计框架,该框架利用基于梯度的最大似然估计和束搜索以获得更好的全局拟合,并给出了一种通过共形预测进行不确定性量化的局部异常检测方法。