面向隐私保护联邦生物信号学习的混合量子启发式 Kolmogorov-Arnold 网络
摘要
本文介绍了一种用于隐私保护联邦 ECG 数据学习的混合量子启发式 Kolmogorov-Arnold 网络,与传统 MLP 相比,在减少参数和通信成本的同时,提高了分类指标。
arXiv:2608.13914v1 公告类型:新
摘要:心电图(ECG)记录是敏感的生物医学数据,限制了医院和可穿戴设备共享原始信号进行集中式模型训练的能力。联邦学习通过协作模型训练,同时将原始生物信号数据保留在各自的源处,解决了这一实际隐私约束。然而,由于客户端样本有限、心律失常标签不平衡以及客户端间非独立同分布(non-IID)数据,联邦 ECG 分类仍然具有挑战性。这些约束要求分类器既具有通信效率,又能抵抗跨客户端分布偏移。在这项工作中,我们在联邦平均(FedAvg)下,评估了混合量子启发式 Kolmogorov-Arnold 网络(HQKAN)与多层感知器(MLP)在 MIT-BIH 数据集上的五类心律失常分类和 INCART 数据集上的三类分类。在多个客户端配置下,HQKAN 提高了大多数聚合和少数类指标,同时在 MIT-BIH 上使用了 37.35% 更少的可训练参数,并将通信成本降低了 24.89%;在 INCART 上,它实现了相应的 44.81% 和 36.41% 的降低。这些结果表明,HQKAN 为隐私保护的联邦生物信号数据学习提供了一种紧凑、通信高效且稳健的替代 MLP 基线的方案。
查看缓存全文
缓存时间: 2026/08/17 10:16
# 面向隐私保护联邦生物信号学习的混合量子启发式柯尔莫哥洛夫-阿诺德网络
来源:https://arxiv.org/html/2608.13914
Chun\-Hua Lin12https://orcid.org/0009-0002-4383-0453, Samuel Yen\-Chi Chen3https://orcid.org/0000-0003-0114-4826, Yu\-Chao Hsu24https://orcid.org/0009-0004-7221-3854, Kuo\-Chung Peng12https://orcid.org/0009-0001-8342-2481, Jiun\-Cheng Jiang127https://orcid.org/0009-0005-1134-4962, Chi\-Sheng Chen5https://orcid.org/0000-0003-0807-0217, Tai\-Yue Li2https://orcid.org/0000-0002-1993-1863, Nan\-Yow Chen2https://orcid.org/0000-0001-8139-6809, En\-Jui Kuo69https://orcid.org/0000-0002-6770-0285, Hsi\-Sheng Goan17810https://orcid.org/0000-0001-8117-5846Affiliation:1Department of Physics and Center for Theoretical Physics, National Taiwan University, Taipei, TaiwanAffiliation:2National Center for High\-Performance Computing, National Institutes of Applied Research, Hsinchu, TaiwanAffiliation:3Brookhaven National Laboratory, Upton, NY, USAAffiliation:4School of Electrical Engineering, Korea Advanced Institute of Science and Technology, Daejeon, KoreaAffiliation:5Beth Israel Deaconess Medical Center, Harvard University, Boston, MA, USAAffiliation:6Department of Electrophysics, National Yang Ming Chiao Tung University, Hsinchu, TaiwanAffiliation:7Center for Quantum Science and Engineering, National Taiwan University, Taipei, TaiwanAffiliation:8Physics Division, National Center for Theoretical Sciences, Taipei, Taiwan
###### 摘要
心电图(ECG)记录是敏感的生物医学数据,这限制了医院和可穿戴设备为集中式模型训练共享原始信号的能力。联邦学习通过允许协作模型训练同时保持原始生物信号数据在其各自的源端,解决了这一实际隐私约束。然而,由于客户端样本有限、心律失常标签不平衡以及客户端之间数据非独立同分布(non\-IID),联邦ECG分类仍具挑战性。这些约束要求分类器既需通信高效,又能抵御跨客户端分布偏移。本研究中,我们在联邦平均(FedAvg)算法下,评估了混合量子启发式柯尔莫哥洛夫-阿诺德网络(HQKAN)与多层感知机(MLP)在MIT\-BIH数据集上的五类心律失常分类和INCART数据集上的三类分类性能。在多种客户端配置下,HQKAN在使用更少37.35%的可训练参数并降低MIT\-BIH上24.89%通信成本的同时,提升了大多数总体和少数类指标;在INCART上,其参数和通信成本分别降低44.81%和36.41%。这些结果表明,HQKAN为生物信号数据的隐私保护联邦学习提供了一种紧凑、通信高效且鲁棒的MLP基线替代方案。
###### 索引术语:
联邦学习,量子启发式柯尔莫哥洛夫-阿诺德网络,心电图,生物信号处理
## I引言
心电图(ECG)广泛用于心律失常筛查\[1 (https://arxiv.org/html/2608.13914#bib.bib1)\],但ECG记录具有隐私敏感性,且通常分布在患者、设备和机构之间。联邦学习(FL)在保持数据本地化的同时训练共享模型,通常通过交换模型更新而非原始信号来实现\[2 (https://arxiv.org/html/2608.13914#bib.bib2)\]。在此设定下,通信、客户端异质性和类别不平衡成为核心设计约束\[3 (https://arxiv.org/html/2608.13914#bib.bib3),4 (https://arxiv.org/html/2608.13914#bib.bib4),5 (https://arxiv.org/html/2608.13914#bib.bib5),6 (https://arxiv.org/html/2608.13914#bib.bib6)\]。
量子启发模型提供了一种利用量子机器学习(QML)\[7 (https://arxiv.org/html/2608.13914#bib.bib7),8 (https://arxiv.org/html/2608.13914#bib.bib8),9 (https://arxiv.org/html/2608.13914#bib.bib9)\]结构特征的实用方法,而无需依赖嘈杂中等规模量子(NISQ)设备\[10 (https://arxiv.org/html/2608.13914#bib.bib10)\]。量子启发式柯尔莫哥洛夫-阿诺德网络(QKANs)是紧凑模型,使用数据重载激活(DARUAN)边缘函数作为其可学习激活,比传统多层感知机(MLP)需要少得多的可训练参数\[11 (https://arxiv.org/html/2608.13914#bib.bib11),12 (https://arxiv.org/html/2608.13914#bib.bib12),13 (https://arxiv.org/html/2608.13914#bib.bib13),14 (https://arxiv.org/html/2608.13914#bib.bib14)\]。混合QKAN(HQKAN)首次在\[13 (https://arxiv.org/html/2608.13914#bib.bib13)\]中提出,它在此基础上构建了一个自动编码器式架构,将全连接编码器和解码器与QKAN潜变量特征处理器配对。由于每轮传输的参数数量是FL中通信开销的主要驱动因素,这种参数效率使HQKAN特别适合联邦设置\[15 (https://arxiv.org/html/2608.13914#bib.bib15),16 (https://arxiv.org/html/2608.13914#bib.bib16),17 (https://arxiv.org/html/2608.13914#bib.bib17),13 (https://arxiv.org/html/2608.13914#bib.bib13),18 (https://arxiv.org/html/2608.13914#bib.bib18),19 (https://arxiv.org/html/2608.13914#bib.bib19)\]。
在本工作中,我们研究HQKAN是否比MLP为联邦ECG分类提供更有效且参数高效的分类器。两个模型在相同的客户端划分和训练预算下进行评估,涉及MIT\-BIH数据集的K∈{8,16,32}个客户端上的五类ANSI/AAMI心跳分类和INCART数据集上的三类ANSI/AAMI分类\[20 (https://arxiv.org/html/2608.13914#bib.bib20),21 (https://arxiv.org/html/2608.13914#bib.bib21),22 (https://arxiv.org/html/2608.13914#bib.bib22),23 (https://arxiv.org/html/2608.13914#bib.bib23),24 (https://arxiv.org/html/2608.13914#bib.bib24)\]。HQKAN在MIT\-BIH上使用11,581个可训练参数,在INCART上使用15,147个,而MLP基线分别为18,485和27,443。在两个数据集上,HQKAN均实现了更强的总体和少数类性能,包括更高的宏F1分数和Cohen'sκ,以及更低的Brier分数。
## II相关工作
联邦学习在分布式客户端上训练共享模型,同时将原始数据保留在设备上,仅共享模型更新,从而符合ECG、脑电图和肌电图等生物医学信号的隐私要求\[2 (https://arxiv.org/html/2608.13914#bib.bib2),25 (https://arxiv.org/html/2608.13914#bib.bib25),26 (https://arxiv.org/html/2608.13914#bib.bib26),27 (https://arxiv.org/html/2608.13914#bib.bib27),28 (https://arxiv.org/html/2608.13914#bib.bib28),29 (https://arxiv.org/html/2608.13914#bib.bib29),30 (https://arxiv.org/html/2608.13914#bib.bib30)\]。将FL应用于ECG带来了非独立同分布(non\-IID)数据、类别不平衡和通信受限的挑战,后续研究通过非IID心律失常检测、迁移和半监督学习以及医院级隐私机制来解决这些问题\[31 (https://arxiv.org/html/2608.13914#bib.bib31),32 (https://arxiv.org/html/2608.13914#bib.bib32),33 (https://arxiv.org/html/2608.13914#bib.bib33),34 (https://arxiv.org/html/2608.13914#bib.bib34),35 (https://arxiv.org/html/2608.13914#bib.bib35),36 (https://arxiv.org/html/2608.13914#bib.bib36),37 (https://arxiv.org/html/2608.13914#bib.bib37),38 (https://arxiv.org/html/2608.13914#bib.bib38),39 (https://arxiv.org/html/2608.13914#bib.bib39),40 (https://arxiv.org/html/2608.13914#bib.bib40),41 (https://arxiv.org/html/2608.13914#bib.bib41)\]。这些努力采用卷积神经网络(CNN)、长短期记忆(LSTM)网络和残差网络(ResNets)等传统骨干网络构建联邦学习框架\[42 (https://arxiv.org/html/2608.13914#bib.bib42),43 (https://arxiv.org/html/2608.13914#bib.bib43)\]。
另一方面,数据重载将经典输入编码为跨电路层重复的单量子比特旋转\[11 (https://arxiv.org/html/2608.13914#bib.bib11),12 (https://arxiv.org/html/2608.13914#bib.bib12)\]。QKANs采用DARUAN机制,使用可训练的单量子比特电路作为边缘函数,取代柯尔莫哥洛夫-阿诺德网络的固定样条激活\[13 (https://arxiv.org/html/2608.13914#bib.bib13)\]。其应用包括太阳周期预测、量子动力学预测、电信预测、流量矩阵预测、量子电路生成和语言建模\[44 (https://arxiv.org/html/2608.13914#bib.bib44),45 (https://arxiv.org/html/2608.13914#bib.bib45),46 (https://arxiv.org/html/2608.13914#bib.bib46),47 (https://arxiv.org/html/2608.13914#bib.bib47),13 (https://arxiv.org/html/2608.13914#bib.bib13),48 (https://arxiv.org/html/2608.13914#bib.bib48),49 (https://arxiv.org/html/2608.13914#bib.bib49),50 (https://arxiv.org/html/2608.13914#bib.bib50),51 (https://arxiv.org/html/2608.13914#bib.bib51)\]。
## III方法
### III\-A数据集与预处理
使用\[53 (https://arxiv.org/html/2608.13914#bib.bib53)\]中预处理的MIT\-BIH心律失常基准数据集\[52 (https://arxiv.org/html/2608.13914#bib.bib52)\]作为主要数据集。每个心跳表示为长度187的单导联波形,归一化到\[0,1\]\[0,1\],必要时进行零填充,并分为五类:非室性早搏(N)、室上性早搏(S)、室性早搏(V)、融合(F)和未知(Q)。原始训练集使用种子标签分层80/20划分,分为70,043个训练心跳和17,511个验证心跳,而官方21,892个心跳的测试集仅保留用于最终评估。该数据集高度不平衡,原始训练集各类别计数为72,471个N、2,223个S、5,788个V、641个F和6,431个Q,多数类与最稀有类之间的不平衡比约为113:1。对于跨数据集评估,INCART数据集按照\[54 (https://arxiv.org/html/2608.13914#bib.bib54)\]的预处理协议处理,并对提取的心跳片段应用相同的\[0,1\]\[0,1]归一化。结果数据集包含104,273个N、1,331个S和13,586个V心跳。
### III\-B联邦设置
联邦优化流水线建立在FLamby\[55 (https://arxiv.org/html/2608.13914#bib.bib55)\]之上,联邦平均(FedAvg)是唯一的聚合方法。在第r∈{1,...,R\}r\\in\\\{1,\\dots,R\\\}轮,客户端k用全局参数θr\\theta^\{r\}初始化其本地模型,训练E个本地轮次,并返回更新后的参数θkr\+1\\theta\_\{k\}^\{r\+1\}。服务器将客户端模型聚合为θr\+1=∑k=1Knk∑j=1Knjθkr\+1\\theta^\{r\+1\}=\\sum\_\{k=1\}^\{K\}\\frac\{n\_\{k\}\}\{\\sum\_\{j=1\}^\{K\}n\_\{j\}\}\\,\\theta\_\{k\}^\{r\+1\}, 其中nkn\_\{k\}表示分配给客户端k的训练心跳数。每个实验配置由分类器选择(HQKAN或MLP)、客户端数量K∈{8,16,32\}K\\in\\\{8,16,32\\\}和数据划分(IID或非IID,集中度α\alpha)定义。每种配置在每轮通信中使用全部客户端参与,并在R=30R=30轮、E=5E=5个本地轮次的相同预算下训练。
两种划分方案构建如下:在IID设置中,每个类别的样本被洗牌并以循环方式分配给客户端。在非IID设置中,客户端特定的标签比例从狄利克雷分布中抽取,集中度参数为α\alpha。主要非IID实验在α=0\.3\alpha=0\.3下进行,鲁棒性通过扫描α∈{0\.1,0\.3,0\.5,1,1000\}\alpha\\in\\\{0\.1,0\.3,0\.5,1,1000\\\}进行评估。
每个客户端最小化按类别频率倒数加权的交叉熵损失,以对抗不同AAMI类别间的严重不平衡,本地更新使用AdamW\[56 (https://arxiv.org/html/2608.13914#bib.bib56)\],学习率为10−310^\{\-3\},权重衰减为10−410^\{\-4\},批大小为128128。仅使用保留的验证集进行模型选择:对于每种配置,我们保留验证宏平均精确率-召回率曲线下面积(AUPRC)在30轮中最大的全局检查点,因为它对少数类性能敏感,而准确率由多数类主导。
### III\-C分类器
两个模型在每个数据集内使用相同的输入,仅在分类器架构上不同。对于MIT\-BIH,展平输入维度为187;MLP基线是一个具有ReLU激活和18,485个可训练参数的全连接网络,而HQKAN结合了全连接编码器、解码器和QKAN潜变量特征处理器,仅需11,581个可训练参数,减少37.35%。对于INCART,相应输入维度为300,MLP有27,443个可训练参数,HQKAN有15,147个,减少44.81%。由于FedAvg同步完整模型状态,通信负载由总参数数量而非仅可训练参数数量决定;按此度量,HQKAN在MIT\-BIH上将每轮通信减少24.89%,在INCART上减少36.41%。HQKAN使用PyTorch中GPU高效的FlashQKAN框架\[57 (https://arxiv.org/html/2608.13914#bib.bib57)\]实现,其融合运算符和块分块通过cuTe DSL\[58 (https://arxiv.org/html/2608.13914#bib.bib58)\]加速,基于开源QKAN实现\[59 (https://arxiv.org/html/2608.13914#bib.bib59)\]构建。
## IV结果与讨论
性能报告包括宏F1、Cohen'sκ\\kappa和Brier分数,以及在一对多约定下的类别正预测值(PPV)、灵敏度(Sen)和特异性(Spe)。宏F1是关键指标,辅以受试者工作特征曲线下面积(AUROC)和AUPRC。客户端标签异质性通过每个客户端的局部标签分布p\\mathbf\{p\}与全局分布q\\mathbf\{q\}之间的平均Hellinger距离H\(p,q\)=12\(∑c=1C\(pc−qc\)2\)1/2H\(\\mathbf\{p\},\\mathbf\{q\}\)=\\tfrac\{1\}\{\\sqrt\{2\}\}\\big\(\\sum\_\{c=1\}^\{C\}\(\\sqrt\{p\_\{c\}\}\-\\sqrt\{q\_\{c\}\}\)^\{2\}\\big\)^\{1/2\}来总结,其中较大的值(H∈\[0,1\]H\\in\[0,1\])表示更强的非IID偏斜。
### IV\-A总体性能
表I (https://arxiv.org/html/2608.13914#S4.T1)和表II (https://arxiv.org/html/2608.13914#S4.T2)分别报告了在MIT\-BIH和INCART上五次种子运行的平均总体性能。在两个数据集上,HQKAN在IID和非IID划分下,在所有报告的总体指标上均持续优于MLP基线。对于MIT\-BIH,随着客户端数量从8增加到32,HQKAN的IID宏F1优势从0\.013增加到0\.054,表明当每个客户端的本地样本数量减少时,其鲁棒性更强。在INCART上也观察到类似趋势,相应差距从0\.023增加到0\.030。在非IID划分下,HQKAN在两个数据集的所有客户端数量上,均持续实现更高的宏F1和κ\\kappa以及更低的Brier分数。在最分散的32客户端设置下,HQKAN在MIT\-BIH上实现0\.761的宏F1,而MLP为0\.698,同时将Brier分数从0\.121降低到0\.094。这种优势在INCART上持续存在,HQKAN实现0\.850的宏F1,而MLP为0\.838,并将Brier分数从0\.040降低到0\.032。这些在两个ECG基准上的一致性提升表明,随着联邦学习变得更加分散和统计异质,HQKAN保持了更强的总体预测性能。相似文章
联邦量子与经典计算:隐私保护混合方法
本文评估了联邦学习在隐私保护混合量子-经典机器学习中的应用,表明其相比本地训练能提高准确性,同时减少通信开销并保持参数效率。
在量子退火器上通过基于QUBO的客户端选择的拜占庭鲁棒联邦学习
本文提出了一种量子退火方法,将联邦学习中的客户端选择重新表述为QUBO问题以防御拜占庭攻击。实验表明,在复杂攻击上,该方法相比经典MultiKrum具有更高的检测准确性,尤其是与MultiSignal集成结合时。
双注意力头用于ECG分类中的个性化联邦学习
本文提出了FedDualAtt,一种用于ECG分类的个性化联邦学习方法,该方法将Transformer注意力头分为全局聚合和局部私有分支,以处理临床站点间的数据异质性。在FedCVD基准上的实验表明,其性能优于现有方法。
植物表型组学中小数据量子学习的监督潜在重构
本文提出了一种面向小数据场景下植物表型组学分类的混合量子-经典工作流,通过监督潜在重构(PCA+LDA)在量子核对齐前提升几何可分性。实验显示可分性有所提升,但揭示了压缩权衡以及实现强量子性能的困难。
通过混合专家模型的量子启发策略进行图像分类
提出了一种基于混合专家模型的量子启发式经典-量子混合框架用于图像分类,在MNIST和Fashion-MNIST数据集上展示了性能提升和错误率降低。