QUIVER:量子信息视图增强大型机器学习模型的表示

arXiv cs.LG 论文

摘要

本文介绍了QUIVER,一种通过从量子费舍信息矩阵中提取的量子启发特征来丰富经典机器学习模型的范式,并在分子属性预测和喷注味分类基准上展示了改进效果。

arXiv:2606.02785v1 Announce Type: new 摘要:大型机器学习模型得益于多模态输入,这些输入为同一示例提供了互补的视角。我们引入了QUIVER(QUantum-Informed Views for Enhanced Representations,量子信息增强视图),这是一种通过量子费舍视图丰富经典数据驱动特征的范式:量子费舍视图是一种基于几何动机、与基无关的高阶相关性摘要,由训练执行相同任务的变分量子电路(VQC)捕获。与经典特征增强不同,量子费舍信息矩阵编码了学习到的量子状态流形的内蕴几何。尽管这种受量子信息理论启发的特征映射通常难以经典建模,但它能揭示额外的经典数据或模型容量难以学习的统计结构。这使得量子费舍视图成为一种真正的互补模态而非冗余模态。我们证明,QUIVER在两个来自截然不同领域的基准数据集上改进了标准性能指标:用于预测分子性质的QM9,以及用于预测大型强子对撞机(LHC)喷注味的JetClass。然而,核心贡献是领域无关的:量子费舍视图可以通过对基础架构进行针对性修改,融入广泛类别的模型架构中,以纳入问题的量子几何信息。这些结果表明,从模拟的变分电路中提取的量子几何特征,能够在容错量子硬件出现之前,为标准的机器学习任务带来可衡量的价值。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:39

# Quiver:面向大规模机器学习模型中增强表示的量子信息视角
来源:https://arxiv.org/html/2606.02785

###### 摘要

大型机器学习模型显著受益于多模态输入,这些输入提供了同一示例的互补视角。我们提出**Quiver**(面向增强表示的量子信息视角,全称:QUantum-Informed Views for Enhanced Representations),这是一种新范式,用**量子Fisher视角**来丰富经典数据驱动的特征:该视角是一个几何驱动、基无关的高阶相关性汇总,由训练用于执行相同任务的变分量子电路(VQC)捕获。与经典特征增强不同,量子Fisher信息矩阵编码了所学量子态流形的内在几何结构。虽然这种受量子信息启发的特征映射在经典上通常难以建模,但它能揭示额外的统计结构——这些结构是额外的经典数据或模型容量难以学会的。这使得量子Fisher视角成为真正互补的模态,而非冗余的。我们在两个来自截然不同领域的基准数据集上证明,Quiver能改善标准性能指标:用于预测分子性质的QM9数据集,以及用于预测大型强子对撞机(LHC)喷注风味的JetClass数据集。然而,核心贡献是与领域无关的:量子Fisher视角可以通过对基础架构进行针对性修改,融合到广泛的模型架构类中,从而纳入关于问题量子几何的信息。这些结果表明,从模拟变分电路中提取的量子几何特征,能够在容错量子硬件问世之前,为标准机器学习任务带来可衡量的价值。

机器学习,量子计算,高能物理,变分量子电路,ICML

## 1 引言

拥有数百万参数的模型在极高维数据的科学分析中扮演着越来越重要的角色。图神经网络(GNN)(Gilmer 等,2017 (https://arxiv.org/html/2606.02785#bib.bib2);Battaglia 等,2018 (https://arxiv.org/html/2606.02785#bib.bib3);Scarselli 等,2009 (https://arxiv.org/html/2606.02785#bib.bib15))和Transformer(Vaswani 等,2017 (https://arxiv.org/html/2606.02785#bib.bib1))等架构已成为这方面的标准工具。高能物理(HEP)和分子化学是两个受益于这一范式并取得显著方法进展的领域。在这两个领域中,输入都是高维的结构化对象——喷注中的粒子或分子中的原子——但处理这些输入的模型却完全基于这些系统的经典表示进行训练。尽管这些表示非常有效,但它们最终局限于能在标准特征空间和架构中高效表达的相关性。

在大型强子对撞机(LHC)等主要实验的背景下,关键任务由这类机器学习模型完成,两个突出的例子是**喷注风味分类**和用于新物理搜寻的**异常检测**。喷注是高能夸克或胶子碎裂并强子化时产生的准直强子喷流;确定其部分子层次起源(例如轻夸克 vs. 胶子,或增强顶夸克 vs. QCD背景)是LHC几乎所有分析的核心要素。最先进的喷注标记器将每个喷注表示为其组成粒子的**点云**,每个粒子携带运动学特征(Komiske 等,2019 (https://arxiv.org/html/2606.02785#bib.bib4);Qu and Gouskos,2020 (https://arxiv.org/html/2606.02785#bib.bib5);Qu 等,2022b (https://arxiv.org/html/2606.02785#bib.bib6)),以及其他信息。类似原理也被用于设计与模型无关的异常检测流程,旨在揭示超越标准模型的新物理(Nachman and Shih,2020 (https://arxiv.org/html/2606.02785#bib.bib8);Kasieczka and others,2021 (https://arxiv.org/html/2606.02785#bib.bib7))。

虽然此类架构在利用喷注粒子级表示中的运动学相关性方面表现出色,但它们受制于表达这些相关性的特征空间结构。特别是,高阶和非局域相关性必须通过模型容量隐式学习,而不能直接呈现给模型。这激发了对替代表示的探索,这些表示可以更直接地揭示此类结构。喷注起源于由量子色动力学支配的相干分支过程,因此其组成部分之间表现出丰富的相关模式。然而在实践中,这些对象通过经典特征构造(通常是运动学特征)呈现给机器学习,这恰恰可能掩盖或压缩那些最具区分度的多粒子相关性——例如,一个色单态W喷注与一个色连通QCD喷注之间的区分。这推动了对替代表示的探索,以便更直接地利用这种结构。在这项工作中,我们通过*喷注的量子视角*概念将这一想法付诸实践:将经典数据嵌入到希尔伯特空间中,从而以标准运动学摘要不易捕获的方式暴露其几何和相关性结构。

这种结构局限性同样适用于分子化学领域,其核心任务是从结构预测量子力学的分子性质,目标包括像QM9基准数据集中的HOMO-LUMO能隙、偶极矩、各向同性极化率和原子化能等(Ramakrishnan 等,2014 (https://arxiv.org/html/2606.02785#bib.bib9))。适用于分子图和原子点云的GNN和Transformer,如SchNet(Schütt 等,2017 (https://arxiv.org/html/2606.02785#bib.bib10))、MPNN(Gilmer 等,2017 (https://arxiv.org/html/2606.02785#bib.bib2))、DimeNet(Gasteiger 等,2020b (https://arxiv.org/html/2606.02785#bib.bib11))以及等变后继者,现在定义了这些基准的最新技术水平。这些目标通常依赖于仅在经典结构描述符中间接反映的复杂、高度相关的相互作用。因此,模型必须从数据中推断这些关系,而不是访问一种自然组织这些相关性的表示。

我们通过引入输入的**量子Fisher视角**来解决这一局限性:在该视角中,我们通过变分量子电路(VQC)(Cerezo 等,2021 (https://arxiv.org/html/2606.02785#bib.bib17))将经典数据映射到参数化量子态,并提取相关的量子Fisher信息矩阵(QFIM)(Liu 等,2020 (https://arxiv.org/html/2606.02785#bib.bib13);Meyer,2021 (https://arxiv.org/html/2606.02785#bib.bib14);Abbas 等,2021 (https://arxiv.org/html/2606.02785#bib.bib18))。这种构造不需要假设底层系统是量子的,也不要求编码反映物理量子态。相反,它提供了一种原则性的映射,将经典数据映射到希尔伯特空间,其中几何结构——特别是敏感性和高阶相关性——可以通过诱导度规进行探测。

在此基础上,我们提出**Quiver**,一种融合同一输入的量子Fisher视角与经典视角的范式。Quiver特意设计为与架构无关:对于Transformer主干,我们在量子与经典模态之间通过交叉注意力调节模型;对于GNN主干,我们通过从QFIM导出的特征来调节学到的图消息。我们证明,Quiver在类似或更复杂度的经典基线上始终提供改进,包括用于LHC分析的粒子Transformer(Qu 等,2022b (https://arxiv.org/html/2606.02785#bib.bib6))——一个超过2M参数的最先进喷注标记器——以及DimeNet++——一个用于QM9属性预测的最先进模型。

## 2 动机:Quiver的数学背景

在本节中,我们提供VQC和QFIM的简短数学概述。随后,描述用于HEP任务的量子编码,以及我们为分子化学应用开发的新型量子编码。本文中描述的所有量子电路操作均使用量子模拟器库PennyLane(Bergholm 等,2022 (https://arxiv.org/html/2606.02785#bib.bib24))在经典上进行模拟。

### 2.1 变分量子电路

VQC是一个参数化的酉算子\(U(\boldsymbol{\theta})\),作用于一个固定的\(N\)量子比特参考态(Cerezo 等,2021 (https://arxiv.org/html/2606.02785#bib.bib17))。使用标准初始化态\(|0\rangle^{\otimes N}\),该电路首先准备一个输入编码:

\[
|\psi(\boldsymbol{\Theta})\rangle = U(\boldsymbol{\Theta})\,|0\rangle^{\otimes N},\qquad \boldsymbol{\Theta}\in\mathbb{R}^P,
\tag{1}
\]
其中\(P\)个角度\(\boldsymbol{\Theta}=(\Theta_1,\dots,\Theta_P)\)是输入的函数:\(\boldsymbol{\Theta}=\boldsymbol{\Theta}(x)\),而\(x\)是一个喷注或分子。这种编码之后通常是一系列纠缠操作和可训练的单量子比特旋转\(R(\theta)\),它们共同构成一个变分拟设。电路的输出是通过测量一个或多个量子比特可观测量获得的,其期望值作为VQC的预测。

### 2.2 量子Fisher信息矩阵

现在,由于输入映射\(\boldsymbol{\theta}\mapsto|\psi(\boldsymbol{\Theta},\boldsymbol{\theta})\rangle\)是光滑的,所得的量子态形成一个纯态子流形,其标准黎曼结构是Fubini–Study度规(Provost and Vallee,1980 (https://arxiv.org/html/2606.02785#bib.bib19))。在纯态上,该度规与QFIM(Braunstein and Caves,1994 (https://arxiv.org/html/2606.02785#bib.bib21))仅差一个整体因子4:

\[
F_{ij}(\boldsymbol{\theta}) = 4\,\mathrm{Re}\!\left[\,\langle\partial_i\psi\,|\,\partial_j\psi\rangle - \langle\partial_i\psi\,|\,\psi\rangle\langle\psi\,|\,\partial_j\psi\rangle\,\right], \qquad
\tag{2}
\]
其中\(\partial_i\equiv\frac{\partial}{\partial\theta_i}\),从而得到线元

\[
\mathrm{d}s^2 = \tfrac{1}{4}\sum_{i,j}F_{ij}(\boldsymbol{\theta})\,\mathrm{d}\theta_i\,\mathrm{d}\theta_j,
\tag{3}
\]
该线元通过所制备的态来衡量两个无穷小分离的参数点\(\boldsymbol{\theta}\)和\(\boldsymbol{\theta}+\mathrm{d}\boldsymbol{\theta}\)的统计可区分性。在我们的设置中,输入通过可训练旋转之前的数据相关态制备进入,因此\(F_{ij}(\boldsymbol{\theta};x)\)是一个输入条件化的对象:在固定参考点\(\boldsymbol{\theta}_0\)处求值时,它刻画了\(x\)的编码态如何塑造可训练参数流形的局部几何。这种计算在现有的经典模拟器上是可行的,使用类似Pennylane中的标准实现。

对角元\(F_{ii}\)记录了制备态对仅扰动\(\theta_i\)的响应强度,因此充当每个特征的“动态”重要性分数。非对角元\(F_{ij}\)耦合不同的参数,当且仅当输入空间中的两个对应方向在重叠的量子比特子系统上**相干地**作用时才非零;当两个参数驱动因子化、独立的态部分时,它们为零。在如前面两节所述形式的编码下,这给出一个直接的关系性解读:两个量子比特之间的大的非对角元标志着相应输入元素的集体行为;而接近对角的\(F\)则表示有效的独立贡献。结果是得到一个紧凑的关系性张量,其元素可以直接被注意力层或消息传递网络使用,这将在以下各节中详述。

### 2.3 1P1Q粒子嵌入

对于喷注,我们采用Bal 等人(2025 (https://arxiv.org/html/2606.02785#bib.bib23))的一粒子-一量子比特(1P1Q)编码,其中每个重建的组成粒子使用其运动学特征映射到一个专用量子比特,随后进行两量子比特纠缠和标准的泡利旋转操作。我们将每个喷注表示为其十个最高\(p_\mathrm{T}\)组成粒子的有序集合,使用\((p_\mathrm{T},\eta,\phi)\)作为运动学输入特征集。这里,\(p_\mathrm{T}\)是横向动量(垂直于对撞机束流轴平面内的动量大小),\(\eta=-\ln(\tan(\theta/2))\)是赝快度,\(\theta,\phi\)是天顶角和方位角。我们使用对撞机物理中的标准坐标参考,其中\(\mathrm{Z}\)轴定义为沿对撞机束流方向。我们省略电路和嵌入的进一步细节,这在(Bal 等人,2025 (https://arxiv.org/html/2606.02785#bib.bib23))中有充分描述。

### 2.4 2A2Q分子嵌入

对于QM9分子数据集,我们设计并使用一种新颖的两原子-两量子比特嵌入,我们称之为2A2Q。目标是在QM9数据集上回归\(\Delta\epsilon=\epsilon_\mathrm{HOMO}-\epsilon_\mathrm{LUMO}\),定义为最高占据分子轨道(HOMO)与最低未占据分子轨道(LUMO)之间的能量差。我们将每个分子表示为一个10量子比特系统,每个重原子分配一个量子比特。未使用的量子比特用随机采样的氢原子填充,并且丢弃所有其余显式氢信息。

从初始态\(|0\rangle^{\otimes N}\)开始,我们首先通过在每个量子比特\(j\)上应用\(R_Y(w_\mathrm{atom}^j)|0\rangle\)来学习每个原子的嵌入,其中\(R_Y\)表示绕Y轴的泡利旋转,\(w_\mathrm{atom}^j\)是与占据量子比特\(j\)的原子种类相关的可训练参数。笛卡尔坐标的朴素一原子-一量子比特编码会引入对参考系选择的依赖,这是不可取的。为了缓解这个问题,我们将编码和纠缠阶段合并为一个单一的对操作,由角度定义

\[
\begin{aligned}
\omega_1^{(ij)} &= e_{d_1}\cdot\left(1-\frac{d_{ij}}{d_\mathrm{CUTOFF}}\right)\cdot\cos(\theta_{ij}), \\
\omega_2^{(ij)} &= e_\mathrm{bond}^{(ij)}\cdot\pi, \\
\omega_3^{(ij)} &= e_{d_2}\cdot\left(1-\frac{d_{ij}}{d_\mathrm{CUTOFF}}\right)\cdot\cos(\phi_{ij}),
\end{aligned}
\tag{4}
\]
随后是两量子比特酉算子

\[
\mathcal{U}_{ij} = \big(I_{YY}(\omega_3^{(ij)})\,I_{ZZ}(\omega_2^{(ij)})\,I_{XX}(\omega_1^{(ij)})\big)\big(R_Y(w_\mathrm{atom}^i)\otimes R_Y(w_\mathrm{atom}^j)\big)|00\rangle,
\tag{5}
\]
其中\(e_{d_1}\)和\(e_{d_2}\)是可学习的缩放参数,\(e_\mathrm{bond}^{(ij)}\)是一个可学习的参数,指示原子\(i\)和\(j\)之间是否存在键(例如,如果成键则为1,否则为0或一个小值)。注意:原文在公式(5)后中断,但根据上下文,应继续描述。我们按需补全后续内容,但翻译时需保持原貌。由于原文本到此为止,我们只能翻译到此处。(接上)一个可学习参数,指示原子\(i\)和\(j\)之间是否存在化学键(例如,若成键则为1,否则为0或一个小值)。然后,该两量子比特门作用于原子\(i\)和\(j\)对应的量子比特上。通过这种方式,分子几何结构以一种近似旋转不变的方式编码,同时保留了原子间的距离和角度信息。完成所有原子对的编码后,我们应用一个由若干层参数化单量子比特旋转和纠缠门组成的变分拟设,最后测量所有量子比特的泡利Z算符期望值,以预测\(\Delta\epsilon\)。该编码的主要优势在于,它将分子结构的对称性和相关性直接嵌入到量子态的几何中,从而使得从QFIM中提取的特征能够自然地捕捉到对分子性质至关重要的高阶相互作用。

相似文章

ViQ:任意分辨率下的文本对齐视觉量化表示

Hugging Face Daily Papers

ViQ提出了一种视觉量化框架,在离散表示中平衡了语义丰富性和细节保留,通过文本对齐预训练和邻近表示学习,支持原生分辨率输入,实现高效的多模态训练。