混合量子预测模型学习几何的实证表征

arXiv cs.LG 论文

摘要

本文实证性地表征了混合量子预测模型的学习几何,通过使用 Neural Tangent Kernel 动态和其他指标将其与经典基线进行比较,表明相似的泛化能力可以从不同的优化轨迹中涌现。

arXiv:2608.19497v1 公告类型:新 摘要:我们通过与一个结构对齐的经典基线进行比较,表征了紧凑混合量子预测模型的学习动态。使用具有可控频谱复杂度和数据可用性的稳态谐波混合和非稳态线性调频基准,我们通过核-目标对齐、核漂移、频谱集中度和训练损失分析了实证 Neural Tangent Kernel 动态。经典模型表现出更强的早期目标对齐,而混合模型通常发展出不太集中的核频谱和较小的核漂移。尽管优化几何不同,两种架构在评估的范围内都达到了相似的留出性能。值得注意的是,混合模型使用了125个可训练参数,而经典基线使用了281个,并在18个频率条件中的15个中更早达到了验证选择的检查点。一个傅里叶增强的经典基线没有重现观察到的训练行为,而一个受控的重新上传消融实验表明,重复编码系统性地修改了优化和核几何。这些结果表明,可比的泛化能力可以从本质上不同的学习轨迹中涌现,并且个体的 NTK 诊断不能提供验证收敛的单调预测因子。该研究不是声称一般的量子优势,而是识别了仅被端点精度所掩盖的架构依赖的学习行为。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:24

# 混合量子预测模型中学习几何的实证表征  
来源:https://arxiv.org/html/2608.19497  
作者:Sandra Leticia Juárez-Osorio, Jorge I. Hernandez-Martinez, Jesus Ivan Ruiz-Martinez, Andres Mendez-Vazquez, Eduardo Rodriguez-Tello  
所属机构:1墨西哥哈利斯科州CINVESTAV计算机科学系 2墨西哥塔毛利帕斯州CINVESTAV分部  
邮箱:\{sandra.juarez, jivan.hernandez, jesus.ruiz, andres.mendez, ertello\}@cinvestav.mx  

###### 摘要  
我们通过与结构对齐的经典基线模型对比,表征了紧凑型混合量子预测模型的学习动态。采用具有可控频谱复杂度和数据可用性的平稳谐波混合与非平稳啁啾基准信号,我们通过核-目标对齐、核漂移、频谱集中度和训练损失分析了经验性神经正切核动态。经典模型表现出更强的早期目标对齐能力,而混合模型通常发展出更分散的核频谱和更小的核漂移。尽管优化几何结构存在差异,两种架构在所评估的范围内均达到了相似的留出性能。值得注意的是,混合模型使用125个可训练参数(经典基线模型为281个),并在18个频率条件中的15个更早达到验证集选择的检查点。傅里叶增强的经典基线未能复现观察到的训练行为,而受控的重编码消融研究表明,重复编码会系统性地改变优化过程和核几何结构。这些结果表明,可比的泛化能力可能源自截然不同的学习轨迹,且单独的神经正切核诊断指标并不能为验证收敛提供单调预测依据。本研究并非宣称普遍性量子优势,而是揭示了被单纯端点准确度所掩盖的架构依赖型学习行为。

## I 引言  
神经网络在优化过程中已知会表现出结构化学习偏差。其中最广泛研究的现象是频谱偏差:目标函数的低频或更平滑成分通常比高频成分更早被学习[10]。这一行为已通过神经正切核(NTK)框架进行理论分析,其中训练动态可通过诱导核的特征谱解释[5]。在此视角下,与较大特征值关联的成分学习更快,而较小特征值方向收敛更慢。因此,核几何结构为理解优化速度、归纳偏差和泛化行为提供了原理性视角。  

这些观点在量子机器学习中引发了一个自然问题:混合量子模型是否以有意义的方式诱导出与可比经典架构不同的学习动态?变分量子电路(VQC)被提出作为通过量子态演化和参数化幺正变换定义的可训练非线性特征映射,其捕获相关性的方式可能与标准神经网络不同[3,11]。然而,许多量子与经典模型的比较主要关注最终预测精度,往往忽略了底层优化几何结构的探索。理解学习动态对于涉及振荡或频谱丰富信号的预测任务尤为重要。在此类问题中,学习几何的差异不仅可能通过最终误差显现,还可能通过模型学习不同频率成分的速度、训练期间核的稳定性以及频谱表示的集中程度表现出来。  

本研究通过受控实证研究探讨这些问题,比较紧凑型混合量子模型与结构匹配的经典基线在可控频谱复杂度的合成多变量预测任务上的表现。我们考虑平稳谐波混合信号与非平稳啁啾信号,同时变化训练集大小以探测数据受限场景。  

不同于仅关注最终预测性能,我们使用训练期间计算的经验性NTK诊断指标分析优化行为。具体追踪核-目标对齐、相对于初始化的核漂移、前1频谱质量以及通过学习曲线下面积(AULC)衡量的学习效率。全程监控验证损失以确定每个模型达到最佳验证选择解的时间点,随后在测试集上评估该解。  

我们的主要贡献总结如下:  
- •引入经验性NTK框架,用于在可控频谱复杂度和数据可用性下比较混合量子与经典学习动态。  
- •识别平稳与非平稳预测基准中核对齐、漂移和频谱集中度的持续性架构依赖差异。  
- •展示125参数的混合模型在留出性能上达到281参数经典基线的几个百分点内,并在大多数评估条件下更早达到验证选择的检查点。  
- •通过傅里叶特征和重编码研究表明,显式周期特征本身无法复现观察到的训练动态,且单独的NTK诊断指标不是收敛的单调预测器。  

本文结构如下:第II节回顾相关背景,第III节描述方法论和实验设置,第IV节展示结果,第V节总结全文。

## II 背景与相关工作  
神经网络的优化动态强烈受目标函数频率结构影响,通常先学习较简单的函数再学习更复杂的函数。Rahaman等人[10]表明,通过梯度方法训练的网络优先拟合目标的低频成分,再捕获高频细节,这一现象称为频谱偏差。他们的傅里叶分析进一步显示低频成分对参数扰动更鲁棒,突出了神经网络学习不同频谱成分的不对称性。  

神经正切核(NTK)框架为这些学习动态提供了原理性视角[5]。在无限宽度极限下,梯度下降中神经网络的演化可描述为函数空间中的核梯度流,由一个在训练期间保持有效不变的确定性核支配。将动态沿核特征函数分解得:  
$$f_t = \sum_i (1 - e^{-\lambda_i t}) \langle y, \phi_i \rangle \phi_i$$  
其中$\lambda_i$和$\phi_i$分别表示核的特征值和特征函数。与较大特征值关联的成分学习更快,而与较小特征值关联的方向收敛更慢。因此NTK特征谱直接建立了核几何与优化动态的联系。  

NTK的谱特性也刻画了其归纳偏差。Bietti和Mairal[1]通过球谐函数分析NTK诱导的再生核希尔伯特空间,表明特征值随振荡成分增强而衰减。因此更平滑的函数被优先表示,而更复杂的成分获得逐渐减小的频谱权重。其分析还揭示了平滑性与近似能力的权衡:较慢的频谱衰减允许更丰富的函数类,但代价是降低规律性。  

这些理论预测得到实证研究支持。Cao等人[2]跟踪由球谐函数构建函数的优化过程,观察到低阶成分比高阶成分更早被学习,与NTK框架预测的频谱动态一致。这些结果共同推动了使用核特征谱及其训练期间演变作为学习动态和归纳偏差的经验诊断工具。  

### II-A 量子计算与变分量子电路  
量子计算利用叠加和纠缠等特性通过量子态演化处理信息[7,9]。除分解和搜索等量子算法[13,4]外,这些特性推动了使用量子电路作为可训练计算组件的量子机器学习模型发展,尤其在混合量子-经典场景中。  

变分量子电路(VQC)也称参数化量子电路,是近期量子机器学习最广泛研究的模型之一[3,11]。VQC结合经典数据编码、参数化幺正门层和可观测量测量。其可训练电路参数通常由经典优化器优化,形成混合学习循环。由于VQC可用相对较浅的电路构建,常在含噪声中等规模量子(NISQ)设备背景下研究[3]。  

经典数据必须首先通过编码操作映射到量子态。常见策略包括振幅编码和角度编码[12]。在角度编码中,经典输入值参数化单量子比特旋转,根据旋转轴和态制备引入数据依赖的振幅或相对相位。编码态随后通过可训练量子门和纠缠操作变换,可观测量测量产生可作为学习特征或预测的经典输出。  

VQC的表示特性取决于编码策略、电路深度、参数化和纠缠拓扑[11,14]。数据重编码通过在多层电路中重复编码输入而非仅引入一次来扩展此构造。这种重复编码可增加电路表示的输入依赖函数类别[8]。本研究采用带数据重编码的旋转编码;具体架构在III-B节定义。  

此处将VQC作为紧凑型非线性特征映射研究,其学习动态可通过经验性NTK分析刻画并与紧密匹配的经典基线比较。我们的目标是识别学习几何差异而非假设普遍性量子优势。

## III 方法论  
### III-A 问题设定  
我们在具有可控频谱复杂度的合成多变量信号上研究预测任务。给定输入序列  
$$X \in \mathbb{R}^{L \times F}$$  
其中$L$是序列长度,$F$是特征数,目标是预测时间步$L+1$处目标变量的下一个值。本研究重点比较紧凑型混合量子模型与结构相当的经典基线在日益复杂的频谱条件下的学习差异。  

### III-B 比较模型  
#### III-B1 混合量子模型  
混合量子模型由经典输入投影、变分量子电路(VQC)和线性读出头组成。输入序列首先投影到等于量子比特数的潜在维度。仅使用最后投影时间步供量子块处理,并缩放为:  
$$x_q = \pi \tanh\left(\widetilde{X}_{L,:}\right) \in \mathbb{R}^Q$$  
其中$Q$表示量子比特数。  

数据编码前,每个量子比特制备为等叠加态,得到初始态:  
$$|\Psi_0\rangle = H^{\otimes Q} |0\rangle^{\otimes Q} = |+\rangle^{\otimes Q}.$$  
此制备确保后续$R_Z$编码从首个编码操作引入输入依赖的相对相位。  

VQC包含$n_{\text{layers}}$个数据重编码层:  
$$U^{(l)}(x_q) = U_{\text{ent}} \left[ \bigotimes_{i=1}^Q \operatorname{Rot}(\phi_{l,i}, \vartheta_{l,i}, \omega_{l,i}) \right] \left[ \bigotimes_{i=1}^Q R_Z(s_l x_{q,i}) \right],$$  
其中$s_l$是可训练重编码缩放因子,$U_{\text{ent}}$以环形拓扑应用CNOT门。输入表示在每个电路层重新编码。最终态为:  
$$|\Psi(x_q)\rangle = U^{(n_{\text{layers}})}(x_q) \cdots U^{(1)}(x_q) |\Psi_0\rangle.$$  
每个量子比特测量一个Pauli-Z期望值:  
$$z_i = \langle \Psi(x_q) | Z_i | \Psi(x_q) \rangle, \quad i=1,\ldots,Q,$$  
所得特征向量传递至线性头生成标量预测。  

#### III-B2 经典基线  
为使比较尽可能受控,我们设计了与混合量子模型结构相同的经典基线。与量子情形类似,输入序列首先投影到$Q$维潜在空间并用$\pi\tanh(\cdot)$缩放。同样仅使用最后时间步进行预测。  

量子模型的重编码策略也引入经典部分。令$y_0 \in \mathbb{R}^Q$表示投影的最后时间步。经典潜在态初始化为$h^{(0)} = y_0$,然后在$n_{\text{layers}}$个阶段更新:  
$$h^{(l+1)} = W^{(l)} \left( \pi \tanh\left(h^{(l)} + y_0\right) \right),$$  
其中每个$W^{(l)}$是无偏置的可训练线性混合层。这样原始输入表示$y_0$在每个层重新注入,提供量子电路执行重复数据编码的经典类比。经典层数与量子重编码层数匹配。  

最终潜在表示通过线性层生成预测。此构造虽未使两模型完全相同,但通过确保两架构在最终读出前跨多层重复混合相同潜在输入,提供了更接近的比较。  

### III-C 可训练参数  
两模型均使用八维潜在空间和四个可训练重编码阶段。由此产生的混合量子和经典模型分别包含125和281个可训练参数。

相似文章

用于神经主题建模的混合经典-量子变分自编码器

arXiv cs.CL

本文提出了一种用于神经主题建模的混合经典-量子变分自编码器,在推理网络中嵌入了参数化量子电路。在AgNews数据集上的实验表明,与最先进的经典模型相比,主题连贯性和多样性有所提高,显示了在NISQ时代量子设备上的可行性。

针对CTF4Science Lorenz挑战的度量感知混合预测

arXiv cs.LG

本文描述了一种针对CTF4Science Lorenz挑战的度量感知混合预测系统,该系统结合了神经去噪器、ODE拟合和直方图尾部分布替代,以优化九个任务对中的不同度量,在公开排行榜上取得了83.85529分的成绩。