基于混合态原型的量子增量学习
摘要
本文介绍了一种基于可训练混合态原型的量子增量学习框架,能够在无需增加电路宽度的前提下添加新类别,同时缓解灾难性遗忘。
arXiv:2608.10464v1 公告类型:新
摘要:增量学习模型需要在参数和内存受限的条件下,顺序地学习新类别而不发生灾难性遗忘。在含噪声中等规模量子(NISQ)时代,尽管量子神经网络在特征映射方面具有优势,但硬件限制制约了电路宽度。此外,传统量子分类器受限于正交基态的数量,这限制了它们容纳持续增长的类别数的能力。为此,我们提出了一种基于可训练混合态原型的新型量子增量学习框架。其独创设计通过添加类别原型来纳入新类别,而不是增加共享量子主干的电路宽度。使用混合态原型是另一项关键贡献,因为相比单一纯态原型,它们具有更强的信息表示能力。并且,可分解的混合态计算降低了生产成本,并为分类提供了便捷的希尔伯特-施密特(HS)距离度量。仿真结果表明,我们的模型使用最少的量子比特即可实现高维特征集中,同时在增量学习任务中展现出比经典基线更低的计算复杂度和更稳健的表示能力。
查看缓存全文
缓存时间: 2026/08/12 08:24
# 基于混合态原型的量子增量学习
Source: https://arxiv.org/html/2608.10464
Yu Wu, Qianli Zhou, Xinyang Deng, Wen Jiang, Kang Hao Cheong, Witold PedryczYu Wu, is with the School of Electronics and Information, Northwestern Polytechnical University, Xi’an, 710072, China and also with the School of Computer Science and Technology, Northwestern Polytechnical University, Xi’an, 710072, China\.Qianli Zhou, Xinyang Deng, and Wen Jiang are with the School of Electronics and Information, Northwestern Polytechnical University, Xi’an, 710072, China\.Kang Hao Cheong is with the School of Physical and Mathematical Sciences, Nanyang Technological University, Singapore 637371, and also with the AI College of Computing and Data Science, Nanyang Technological University, Singapore 639798 \(e\-mail: kanghao\.cheong@ntu\.edu\.sg\)\.Witold Pedrycz is with the Department of Electrical and Computer Engineering, University of Alberta, Edmonton, AB T6G 2R3, Canada, the Institute of Systems Engineering, Macau University of Science and Technology, Taipa 999078, Macau SAR, China, Systems Research Institute, Polish Academy of Sciences, 00\-901 Warsaw, Poland, and Research Center of Performance and Productivity Analysis, Istinye University, Istanbul, Türkiye \(e\-mail: wpedrycz@ualberta\.ca\)\.本工作得到了中国博士后科学基金(批准号:2025M784414)和博士后创新人才支持计划(批准号:BX2026481)的部分资助。稿件于2021年4月19日收到;2021年8月16日修订。
###### 摘要
增量学习模型需要在参数和内存受限的条件下,依次学习新类别而不会发生灾难性遗忘。在含噪中等规模量子(NISQ)时代,尽管量子神经网络在特征映射方面具有优势,但硬件限制制约了电路宽度。此外,传统的量子分类器受限于正交基态的数量,限制了其容纳不断增长类别数的能力。为此,我们提出了一种基于可训练混合态原型的新型量子增量学习框架。其独特设计通过添加类别原型来纳入新类别,而不是增加共享量子骨干电路的宽度。使用混合态原型是另一个关键贡献,因为它们比单一纯态原型具有更强的信息表示能力。此外,可分解的混合态计算降低了制备成本,并为分类提供了便捷的Hilbert–Schmidt(HS)距离度量。仿真结果表明,与经典基线相比,我们的模型能以最少数量的量子比特实现高维特征集中,并在增量学习任务中展现出更低的计算复杂度和稳健的表示能力。
## I引言
深度学习在假设所有训练数据一次可用的前提下取得了巨大成功。然而,真实世界的数据通常以连续、不断变化的数据流形式出现。为了纳入新类别而从头反复训练模型,在计算上是极其昂贵且低效的,尤其对于资源受限的应用\[zhou2024class\]。因此,增量学习应运而生,它能够在最小化存储和计算开销的同时,用新知识持续更新模型\[zhang2025few,masana2022class\]。
在增量学习中,根本性挑战是灾难性遗忘,即神经网络在适应新任务时会抹去先前学到的表示\[gao2022r,mccloskey1989catastrophic\]。早期工作引入了记忆回放,通过小缓冲区的历史样本显式地进行复习\[rebuffi2017icarl,wang2022foster,douillard2020podnet\],同时使用参数正则化和知识蒸馏来约束关键权重的更新\[kirkpatrick2017overcoming,li2017learning,smith2021always\]。由于存储原始数据往往受内存限制或隐私问题约束,后续研究探索了无样本统计原型匹配\[huang2026incomplete,huang2026dual\],通过提取和冻结抽象表示来避免迭代重训练\[petit2023fetril,goswami2023fecam,zhu2021prototype\]。最近,动态网络被提出通过扩展架构分支来缓解遗忘\[van2022three,zhao2026multidomain\]。尽管有上述多种尝试,经典增量学习仍面临计算开销和表示漂移残留的瓶颈,这限制了其在实际中的可扩展性\[zhou2024class\]。
借助量子力学,量子计算引入了一种根本不同的信息处理范式,促进了量子机器学习研究的快速深入\[xu2024quantum,zhan2026ternary\]。在NISQ时代,基于变分量子电路(VQC)的混合架构已显示出巨大潜力\[li2025efficient\]。通过将经典数据映射到指数级膨胀的希尔伯特空间中,VQC能够高效地操作高度非线性的特征\[shi2025quantum,cerezo2021variational,xiao2026adaptive\]。因此,与经典网络相比,量子模型能以显著更少的参数达到有竞争力的精度\[shindi2023model\]。此外,量子纠缠捕获非局域关联,为增强模型表达能力提供了物理基础\[deng2023novel,xiao2022negation\]。近期研究已将量子神经架构扩展到包括人类可靠性分析\[su2026dependence\]、多模态特征融合\[wu2026feature,yang2025multimodal\]和蛋白质折叠预测\[shi2026qsyncfold\]等任务。此外,Shi等人\[shi2024qsan\]创造性地提出了基于量子逻辑相似性的量子自注意力机制,能够在减少中间测量的同时高效、准确地计算注意力分数和输出,进一步探索了NISQ时代量子机器智能的发展潜力。
尽管有这些理论优势,经典增量学习策略无法直接量子化,因为量子网络与经典网络之间存在结构性差异\[jiang2022quantum\]。在经典深度学习中,容纳新类别通常只需扩展最后的线性层即可。然而,一大类常用的量子分类器是从固定的基态概率或期望值集合构造类别分数的\[du2023problem,nghiem2021unified\]。随着标签空间增长,这些分类器可能需要扩展测量或读出规则、增加可观测量,或引入更多类别相关参数。在基态编码方案中,容纳额外类别可能还需要增加量子比特。关键的是,与模块化的经典扩展不同,追加一个量子比特会从根本上改变全局量子态和底层希尔伯特空间。这种结构性变化会破坏先前学到的纠缠关联,加剧灾难性遗忘\[zhang2026experimental\]。此外,盲目增加电路宽度或深度必然会引发贫瘠高原现象,导致量子网络无法训练\[yuan2023optimal\]。
为了规避这种结构性扩展困境,量子度量学习成为一种有前景的范式。通过基于状态距离而非显式参数化分类头来对实例分类,它天然避免了对电路加宽的需求。其有效性在很大程度上依赖于对先进量子信息表示的探索\[lloyd2020quantum,huang2026individual\]。在量子特征映射中,纯态将单个输入编码为希尔伯特空间中的单一单位状态向量\[dong2019learning\]。因此,与混合态相比,纯态缺乏表示多样分布的统计能力。通过将信息表述为正交状态的凸组合,混合态封装了数据随机性和复杂的类内方差\[ezzell2023quantum\]。与经典信息表示相比,这种量子方法在表示维度上呈指数级扩展。此外,它提供了有物理依据的距离度量,如HS距离、迹距离和Bures距离\[travnivcek2019experimental\]。最终,这些综合优势有助于解决增量学习任务中的问题。\[asadi2023prototype\]。
\(a\) 样本回放新数据Dt\mathcal\{D\}\_{t}记忆Et−1\mathcal\{E\}\_{t\-1}旧模型Θt−1\Theta\_{t\-1}新模型Θt\Theta\_{t}微调更新\(b\) 正则化新数据Dt\mathcal\{D\}\_{t}旧模型Θt−1\Theta\_{t\-1}(冻结)新模型Θt\Theta\_{t}正则化\(c\) 原型分类x\mathbf\{x\}编码器FF嵌入空间图 1:增量学习策略示意图。\(a\) 样本回放;\(b\) 正则化;\(c\) 原型分类。受混合态表征能力和量子电路物理约束的启发,本文提出了一种基于混合态原型的新型量子增量学习框架。为了突破传统量子分类器的容量瓶颈,我们的设计从显式的softmax回归分类转向隐式的、基于距离的原型匹配机制。此外,考虑到动态改变量子网络的难度,我们设计了一种混合架构:我们追加一个轻量级、可扩展的经典模块(即MLP)来管理增量类别调整,同时不干扰底层量子态。本研究的主要贡献总结如下:\(1\) 一种带有可扩展模块的量子原型框架,避免了正交基态相关的容量限制。\(2\) 通过对纯态动态加权得到的混合态原型,避免了冗余量子比特,并提供了类似PCA的噪声滤波特性。\(3\) 在静态和增量分类任务上的实验证明了高维语义集中性,展现出参数优势和噪声鲁棒性。
本文其余部分的结构如下。第II节 (https://arxiv.org/html/2608.10464#S2)介绍了增量学习和混合态编译的预备知识。LABEL:sec:Mixed-state_based_quantum_prototype_classifier详细阐述了混合态量子原型分类器的构建。LABEL:sec:Quantum_Incremental_Learning_Framework全面介绍了整体增量学习框架。LABEL:sec:Experiment提供了实验评估,LABEL:sec:conclusion对全文进行了总结并讨论了若干未来方向。
## II预备知识
本节简要概述增量学习和量子混合态编译中的关键概念,这些概念构成了我们提出的框架的基础。
### II-A增量学习策略
增量学习要求模型从连续的数据流中依次学习新类别,而不会灾难性地遗忘先前获得的知识。为了在学习新任务所需的可塑性与保留旧任务所需的稳定性之间取得平衡,当前经典增量学习框架通常依赖三种基本策略,如图1 (https://arxiv.org/html/2608.10464#S1.F1)所示。
#### II-A1样本回放策略
回放机制通过保留有界的历史数据记忆来缓解遗忘。一个著名的例子是iCaRL\[rebuffi2017icarl\],它利用放牧算法为每个已观察类别选择并存储少量高度代表性的样本。在增量训练阶段,这些样本与新类别实例一起被回放。这使得模型能够回顾过去的知识,从而有效防止决策边界发生灾难性遗忘。
#### II-A2正则化技术
正则化方法不是直接重用原始数据,而是对网络的优化轨迹施加数学约束。基于参数的正则化方法如EWC\[kirkpatrick2017overcoming\]评估网络各权重对过去任务的重要性,并惩罚这些关键参数的剧烈偏离。此外,知识蒸馏技术如LwF\[li2017learning\]缓解网络的表示漂移。它们迫使更新后的模型模仿冻结旧模型的输出logits或中间特征表示,从而隐式地保留过去知识的拓扑结构。
#### II-A3基于原型的分类
由于新旧类别之间的数据不平衡,传统分类器在增量学习中会面临任务近期偏差问题。为解决这一问题,基于原型的推理依赖于嵌入空间中的距离度量\[asadi2023prototype\]。类似iCaRL中的样本均值最近邻分类器,或者FeTrIL和FeCAM中的质心分类器\[petit2023fetril,goswami2023fecam\],都使用全局原型表示每个类别。输入实例通过分配给最近的类别原型来进行分类。这种将特征提取与显式分类解耦的方式有效缓解了固有权重/偏向,并为所提出的量子原型设计提供了理论基础。
### II-B量子混合态编译
量子态编译旨在学习一个参数化量子电路,使其能够制备目标状态的可靠近似。早期工作主要关注纯态,而混合态编译为处理NISQ时代中的经典概率、噪声和复杂数据分布提供了更通用的框架\[cerezo2020variational\]。
#### II-B1密度矩阵与混合态表示
在量子力学中,具有完整信息的封闭量子系统用纯态描述,由希尔伯特空间中的状态向量\|ψ⟩\|\\psi\\rangle表示。然而,在实际开放量子系统中,尤其是在NISQ时代,主系统不可避免地与环境相互作用并发生退相干。对环境求迹会产生一个约化混合态。混合态用密度矩阵ρ\\rho描述,它是迹为1的正半定厄米算子Tr\(ρ\)=1\\text\{Tr\}\(\\rho\)=1。根据谱分解定理,任何混合态ρ\\rho都可以表示为一组正交纯态的概率组合:
ρ=∑iλi\|vi⟩⟨vi\|,\\rho=\\sum\_\{i\}\\lambda\_\{i\}\|v\_\{i\}\\rangle\\langle v\_\{i\}\|,\(1\)其中λi≥0\\lambda\_\{i\}\\geq 0是特征值,表示系统处于相应纯本征态\|vi⟩\|v\_\{i\}\\rangle的经典概率,满足∑iλi=1\\sum\_\{i\}\\lambda\_\{i\}=1。
ρtar\\bm\{\\rho\}\_{\\text\{tar\}}\|1⟩\|1\\rangleVQCSwap Test\|φ1⟩\|\\phi\_\{1\}\\rangle\|2⟩\|2\\rangleVQCSwap Test\|φ2⟩\|\\phi\_\{2\}\\rangle\|K⟩\|K\\rangleVQCSwap Test\|φK⟩\|\\phi\_\{K\}\\ranglep1p\_\{1\}p2p\_\{2\}pKp\_\{K\}F1F\_\{1\}F2F\_\{2\}FKF\_\{K\}F^\\hat\{F\}⋮\\vdots⋮\\vdots⋮\\vdots⋮\\vdots
图 2:通过CCPS进行HS距离测量。VQC和交换测试是共享的。
#### II-B2纯态凸组合ansatz
态纯化ansatz准备一个更大的纯态并对辅助寄存器求迹,这会增加所需电路宽度。纯态凸组合(CCPS)ansatz通过将秩为RR的混合态表示为变换基态的概率混合来避免这一开销\[ezzell2023quantum\]:
σCCPS\(α,R\):=∑i=0R−1pφ\(i\)Uθ\|i⟩⟨i\|Uθ†,\\sigma\_{\\text\{CCPS\}\}\(\\bm\{\\alpha\},R\):=\\sum\_\{i=0\}^\{R\-1\}p\_\{\\phi\}\(i\)U\_相似文章
量子增强扩散语言模型的电路超网络
HyperQ 在冻结的掩码扩散语言模型中引入了令牌条件化的量子残差分支,使用电路超网络动态生成量子电路参数。这种方法在基准测试中提高了性能,并且计算效率高,与经典基线相比需要更少的微调示例。
通过混合专家模型的量子启发策略进行图像分类
提出了一种基于混合专家模型的量子启发式经典-量子混合框架用于图像分类,在MNIST和Fashion-MNIST数据集上展示了性能提升和错误率降低。
Gated QKAN-FWP:可扩展的量子启发序列学习
本文提出了 Gated QKAN-FWP,这是一个可扩展的量子启发序列学习框架,它通过单量子比特数据重新加载电路,将快速权重程序员(Fast Weight Programmers)与柯尔莫哥洛夫-阿诺德网络(Kolmogorov-Arnold Networks)相结合。
一种用于图少样本类增量学习的轻量级可塑性记忆框架
本文提出了一种用于图少样本类增量学习的轻量级可塑性记忆框架,该框架使用一种演化的微聚类结构和元学习,以在有限数据下平衡知识保留和对新类别的适应性。
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。