从超平面到超椭球:线性与单量子比特混合态二分类模型的内在可解释性表征

arXiv cs.LG 论文

摘要

本文系统表征了线性模型与单量子比特混合态模型在二分类任务中的内在可解释性差异,揭示了量子模型学习的是超椭球而非超平面,并探讨了这一发现对归纳偏置及教学法的启示。

arXiv:2607.15433v1 公告类型:新 摘要:我们表征并比较了标准线性模型与单量子比特混合态模型在监督二分类任务中的内在可解释性。对比发现,单量子比特混合态二分类模型本质上是标准线性模型的“椭球版本”。更准确地说,该模型并非学习一个超平面来分类数据,而是学习一个超椭球。我们讨论了两类模型几何归纳偏置的差异,以及每种模型如何包含不同的特征重要性归纳偏置。这篇简明表征为零量子背景且仅熟悉机器学习中线性分类的读者提供了接触量子机器学习(ML)概念的可达路径。为支持ML教学法,我们鼓励教师利用本文,在本科生ML课堂中平滑引入量子ML概念。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:27

# 从超平面到超椭球:刻画线性与单量子比特混态二分类模型的内在可解释性
来源:https://arxiv.org/html/2607.15433
(2026年7月9日)

###### 摘要

我们刻画并比较了标准线性模型与单量子比特混态模型在监督二分类任务中的内在可解释性。并排对比揭示,单量子比特混态二分类模型本质上只是标准线性模型分类的“椭球版本”。更精确地说,我们不是学习一个*超平面*来对数据进行分类,而是学习一个*超椭球*。我们讨论了两类模型的几何归纳偏差的后果,以及每个模型如何包含不同的特征重要性归纳偏差。这一简短的刻画为没有量子背景、仅熟悉机器学习中线性分类的读者提供了一条通向量子机器学习(ML)概念的可理解路径。为支持机器学习教学,我们鼓励教师利用本文内容,将量子机器学习概念平滑地引入本科机器学习课堂。

## 1 引言

在最近的一篇观点文章中[gili2026inherent],我们主张进行更多研究,对机器学习模型的内在可解释性进行并排刻画[Zschech2025Inherently]。动机很简单:这种刻画揭示了模型之间的结构性差异,这些差异意味着模型在与相同数据交互时具有不同的偏差。理解这些数学偏差及其后果,能使机器学习研究人员和实践者设计出具有可验证数学原理的现实世界方法。从教学角度来看,这些刻画也具有建设性。当向学生介绍时,它们鼓励使用数学对象进行机制推理[mech_reason],以理解模型行为并设计具有所需行为的模型。此外,它们可以帮助专家认识到自身领域内模型与外部开发的模型之间的联系。

在这篇简短的刻画中,我们将标准的线性模型[Bishop-book-2006, hastie2009elements, james2021introduction]与单量子比特混态模型[nielsen2010quantum]在监督二分类任务上进行比较。线性模型分类可以说是各行各业中使用最广泛的机器学习方法——主要因其简单性和内在可解释性[fan2008liblinear]。这些模型通常被用作深度神经网络的最后一层分类头[he2016deep, BERT],或作为来自基础模型的冻结嵌入的分类器(称为线性探测)[alain2016understanding, evci2022head2toe]。有时,这些模型甚至能与深度非线性模型表现相当[schulz2020different],或针对特定问题完全超越它们[arshad2023powersimplicitysimplelinear]。线性分类通常是本科机器学习入门课程中最早讲授的参数化方法之一[james2021introduction]。在光谱的另一端,单量子比特(qubit)混态模型通常被视为需要量子信息科学的专门知识才能理解和使用[nielsen2010quantum]。该模型名称中包含“qubit”一词——对许多人来说,这立即触发一种难以接近的感觉。实际上,学生可能只有在研究生量子信息课程中才能学到这个模型——完全与机器学习方法分开。

我们证明,如果忽略复杂的术语,单量子比特混态二分类模型本质上只是标准线性模型分类的“椭球版本”。更精确地说,我们不是学习一个*超平面*来对数据进行分类,而是学习一个*超椭球*。我们刻画了两类模型在几何归纳偏差上的差异,以及量子比特情形下权重归一化约束带来的额外限制的影响。在后一种偏差中,我们观察到线性模型通过*绝对*特征重要性提供内在可解释性,而单量子比特混态模型则提供*相对*特征重要性。

我们有意保持这篇刻画的简短且对没有量子信息背景的读者友好,因为我们有兴趣支持机器学习教学。基于下文发展的理论,在现实数据环境中对模型可解释性进行实证研究,仍是未来研究的一个开放方向。

## 2 二分类模型的刻画

参见标题 (a) 线性模型
参见标题 (b) 单量子比特混态模型

图1: 两个数据特征的 toy 分类示例。(a) 模型只能学习一条直线的斜率来分离数据。(b) 模型只能学习一个椭球的半轴长度来分离数据。让我们考虑一个传统的监督学习分类问题。我们有一个训练数据集 D = {x_i, y_i}_{i=1}^N,其中 x_i ∈ ℝ^D,y_i ∈ {0,1}。我们的目标是训练一个参数化模型,根据真实二分类标签 y_i = 0 或 y_i = 1 对输入数据 x_i 进行分类,并泛化到假设与训练集来自同一底层分布的未见数据。通常,我们使用逻辑损失函数来训练这样的模型。下面,我们刻画线性模型和单量子比特混态模型在这项任务中的可解释性。

### 2.1 线性模型

让我们考虑一个线性分类模型。对于单个数据点 x_i,线性模型的形式为:

f_w(x) = w_1 x_1 + w_2 x_2 + ⋯ + w_D x_D + β   (1)

每个可训练权重 w_d ∈ ℝ 直接影响一个数据特征 x_d,其加权和加上标量偏置 β ∈ ℝ 就是整个数据输入 x_i 的模型输出。在这种形式下,参数化权重在训练中是无界的——尽管可以添加约束。如果原始数据特征相对于其他特征非常大,我们使用 min-max 归一化将每个数据点 x_i 映射到 [0,1]。这种归一化使得模型输出对学习到的特征权重比输入数据的绝对尺度更敏感。我们将二分类决策阈值设为零,因此最终决策函数为 sign(f_w(x))。

绝对特征重要性。每个特征权重 w_d 的符号(正或负)指示该特征将模型输出推向类别 0 还是类别 1。其大小 |w_d| 表示该特征权重对分类输出的*绝对重要性*。因此,我们理解哪些特征对模型行为有高或低的影响。

学习超平面。当 f_w(x) = 0 时,我们得到一个 D-维超平面,因此我们正在学习这个分离数据的超平面。权重决定了超平面的方向和位置。线性模型的约束是它们*只能*学习线性决策边界。因此,如果数据不是线性可分的,无论有多少额外数据,线性模型的几何表达能力都不足以完美分类。参见图1(a)(https://arxiv.org/html/2607.15433#S2.F1.sf1)中一个标准的两个数据特征 toy 示例。相反,如果我们知道数据是线性可分的,为什么还要使用更复杂的东西?

### 2.2 单量子比特混态模型

现在让我们考虑一个单量子比特混态模型¹。为了揭示模型的超椭球结构,我们需要介绍量子信息科学中的两个概念——量子比特态和量子比特测量[nielsen2010quantum]。然而,我们鼓励读者不要密切关注这些概念的物理含义(例如,原子的物理状态及其通过相互作用的观测);相反,重要的是关注代表物理对象的数学对象(即单位向量和厄米矩阵)。

一个*纯*单量子比特态是一个 2-维列单位向量,包含复系数 α ∈ ℂ 和 β ∈ ℂ。我们将其记为 v_pure = (α; β)。由于 v_pure 是单位向量,我们知道系数受约束 |α|² + |β|² = 1。系数指示向量在单位球面上的旋转坐标。

一个*混*单量子比特态是纯模型外积的线性求和,每个外积乘以某个概率 p。我们将数据点 x_i 中的每个数据特征 d 编码到每个纯态的 α 系数中。这种技术是幅度编码的一种形式[grover2002creating, Rebentrost-PRL-2014]。由于我们的所有数据都是实值的,从这一点开始,我们将 α 和 β 限制为实数。每个概率 p_d 是可训练的特征权重,类似于上面的权重 w。由于 α² < 1,我们使用 min-max 归一化将所有数据特征 x_d 映射到 [0,1](与线性模型相同)。在这些条件下,我们观察到以下单量子比特混态:

v_mixed = ∑_{d=1}^D p_d v_pure(x_d) v_pure^T(x_d)
         = ∑_{d=1}^D p_d (|x_d|²  x_d β; β x_d  |β|²)
         = ∑_{d=1}^D p_d (|x_d|²  x_d β; β x_d  1-|x_d|²)   (2)

注意,对角线可以用这种形式写出是因为 |α|² + |β|² = 1。因此,量子信息强加了归一化约束 Tr(v_mixed) = 1。

到目前为止,我们有了混量子态 v_mixed ∈ ℝ^{2×2},但还不是完整的单量子比特混态模型。完整的模型包括对这个量子态关于所选随机变量(例如,系统能量)的测量。测量特定随机变量的期望值是该状态 v_mixed 与可能的随机变量结果(表示为厄米(实特征值)矩阵 O ∈ ℂ^{2×2})乘积的迹(对角线元素之和)。

如果我们选择一个标准的二进制计算测量 Z = (1 0; 0 -1),单量子比特混态模型写为:

f_p(x) = Tr[ v_mixed O ]
         = Tr[ ∑_{d=1}^D p_d (|x_d|²  x_d β; β x_d  1-|x_d|²) (1 0; 0 -1) ]
         = Tr[ ∑_{d=1}^D p_d (|x_d|²  -x_d β; β x_d  |x_d|²-1) ]
         = 2( p_1 |x_1|² + p_2 |x_2|² + ⋯ + p_D |x_D|² ) - 1   (3)

每个可训练权重 p_d 直接缩放对应输入特征 x_d 的平方贡献,其加权和就是整个数据输入 x_i 的模型输出。在这种标准形式下,参数化权重在训练中*是有界的*——与标准线性模型不同。概率被界为 0 ≤ p_d ≤ 1。我们将二分类决策阈值设为零,因此最终决策函数为 sign(f_p(x))。

相对特征重要性。所有概率权重都是正的,因此每个权重的符号不提供关于其对分类结果贡献的信息。然而,约束 ∑_{d=1}^D p_d = 1 为每个特征对模型输出的贡献添加了一个固有可解释的偏差:相对重要性。因此,该模型编码了某些特征比其他特征更重要的偏差——类似于 Transformer 架构中自注意力的偏差。

学习超椭球。注意到单量子比特混态模型最终的形式与式(1)中的线性模型相似,只是前者不是线性超平面的结构,而是*超椭球*的结构。当决策阈值为零时,我们得到以下以原点为中心的超椭球边界:

x_1² / a_1² + x_2² / a_2² + ⋯ + x_D² / a_D² = 1   (4)

系数 a_d 是半轴长度——即从原点到椭球边界沿每个方向的距离。从我们的模型式(3)中,我们观察到 a_d = 1 / √(2p_d)。因此,改变每个概率在几何上等同于沿着不同的特征方向拉伸或收缩椭球。参见图1(https://arxiv.org/html/2607.15433#S2.F1)中 D=2 时两个模型在 toy 数据上的比较。当所有数据特征具有相等相对重要性时(p_d = 1/D),我们得到一个以原点为中心的*超球*,半径为 r = √(D/2)。当 p_d = 1 时,超椭球沿特征方向被压缩得最厉害,而当 p_d → 0 时则无限伸展。当 p_d = 0 时,对应特征不再对决策边界有贡献,导致超椭球在该方向无界,几何上简化为超圆柱。因此,从实际实现的角度来看,将概率权重下界设为一个小的正值(例如 10^{-9})很重要,以防止决策边界沿任何特征方向变得无界。与线性模型类似,单量子比特混态模型只能学习椭球形的决策边界。图1(a)(https://arxiv.org/html/2607.15433#S2.F1.sf1)展示了一个 toy 场景,其中这种椭球边界能够分离线性分类器无法分离的数据。虽然这提供了环绕数据的更大曲率,但该模型仍然比能够将超椭球平移离开原点的模型更受限制。

对于有兴趣了解更多关于单量子比特混态模型用于机器学习的读者,我们推荐参考文献[sergioli2016pattern, leporini2022efficient, bertini2023quantum]。在这些不同的参考文献中,作者探索了模型,其路径超过了当前刻画的范围。

相似文章

幻觉可从量化大语言模型中间层隐藏状态线性解码

arXiv cs.LG

本文研究开源量化大语言模型的隐藏状态中是否编码了线性可分的真实性信号。在三个7B-8B指令调优模型上,对单个网络中间层的线性探针在幻觉检测基准上达到0.904-1.000 AUROC,优于基于采样的方法。