量子核估计用于早期肺癌检测的发现
摘要
本文评估了使用cfDNA片段组学和甲基化数据的量子-经典混合机器学习用于肺癌检测,结果显示量子核模型与传统基线相比具有竞争力的性能。
arXiv:2608.19304v1 Announce Type: new
摘要:低剂量胸部计算机断层扫描筛查肺癌可降低死亡率,但其影响受限于接受度、依从性和管理挑战。基于血液的游离DNA (cfDNA) 生物标志物提供了一种互补方法,尽管早期检测仍然困难,因为肺癌的异质性和高维非线性分子信号。我们评估了使用DNA片段组学和DNA甲基化的量子-经典混合机器学习用于肺癌检测。经过特征选择后,使用20和40个特征子集训练模型。特征使用角度和密集角度特征映射以及多种纠缠策略编码到量子希尔伯特空间中。基于保真度的量子核通过精确态矢量模拟计算,并与预计算核SVM和核PCA逻辑回归集成,并与在原始特征上训练的SVM模型进行比较。
该框架实现了对编码和纠缠设计如何影响分类的系统评估。在重复的留出评估中,量子核模型在两个数据集上都达到了具有竞争力的性能。对于片段组学,多个20特征配置提高了AUC相对于经典SVM基线,表明有效捕获了非线性cfDNA片段结构。对于甲基化,经典SVM达到了最高的AUC,尽管选定的量子模型仍然具有竞争力,并在某些情况下提高了特异性。将特征从20增加到40并未一致提高性能,并且经常增加变异性。总体而言,这些结果支持量子核方法作为基于cfDNA的肺癌检测的一种有前景的方法。
查看缓存全文
缓存时间: 2026/08/21 10:21
# 量子核估计用于早期肺癌检测的发现 来源:https://arxiv.org/html/2608.19304 Alex Zajichek2 Hakan Doga3 Laxmi Parida3 Filippo Utro∗,3 and Peter J. Mazzone∗,4 地址:1美国俄亥俄州克利夫兰市,克利夫兰诊所研究中心,计算生命科学部;2美国俄亥俄州克利夫兰市,克利夫兰诊所研究中心,定量健康科学部;3美国纽约州约克镇高地,IBM Thomas J. Watson 研究中心,IBM Quantum;4美国俄亥俄州克利夫兰市,克利夫兰诊所,肺内科。∗通讯作者:[email protected] 和 [email protected] ###### 摘要 量子机器学习、量子核估计、cfDNA片段组学、DNA甲基化、肺癌。 摘要:低剂量胸部计算机断层扫描(LDCT)肺癌筛查可降低死亡率,但其效果受限于人群接受度、依从性和筛查后管理方面的挑战。基于血液的无细胞DNA(cfDNA)生物标志物提供了一种补充方法,然而,由于肺癌的异质性以及高维、非线性的分子信号,早期检测仍然困难。我们评估了用于肺癌检测的量子-经典混合机器学习方法,该方法利用DNA片段组学和DNA甲基化数据。经过特征选择后,模型使用20个和40个特征子集进行训练。特征通过角度和密集角度特征映射,结合多种纠缠策略,被编码到量子希尔伯特空间中。基于保真度的量子核通过精确态矢量模拟计算,并与预计算核支持向量机和核主成分分析(KPCA)逻辑回归相结合,同时与一个在原始特征上训练的支持向量机模型进行比较。 该框架能够系统评估编码和纠缠设计如何影响分类性能。在重复的留出评估中,量子核模型在两个数据集上都实现了有竞争力的性能。对于片段组学数据,多种20特征配置的AUC(曲线下面积)优于经典支持向量机基线,表明其有效捕捉了cfDNA片段化结构的非线性特征。对于甲基化数据,经典支持向量机取得了最高的AUC,尽管选定的量子模型仍具有竞争力,并在某些情况下提高了特异性。将特征从20个增加到40个并未一致提升性能,且通常增加了变异性。总体而言,这些结果支持量子核方法作为基于cfDNA的肺癌检测的一种有前景的途径。 ††脚注文本:文章版本:2026年8月19日 h\\currenttimeCET## 1引言 使用每年一次的低剂量胸部CT扫描(LDCT)进行肺癌筛查,已被证明可以降低适合早期干预的高风险人群的死亡率\[7 (https://arxiv.org/html/2608.19304#bib.bib1),1 (https://arxiv.org/html/2608.19304#bib.bib2)\]。然而,筛查项目的整体影响因合格人群接受速度缓慢、年度筛查依从性低,以及管理筛查发现的不确定性肺结节等挑战而减弱。 更准确、更易获取且风险更低的诊断工具有助于改善肺癌筛查的实施,并帮助在人群层面优化临床益处与风险之间的平衡。在此背景下,基于血液的分子生物标志物,包括无细胞DNA(cfDNA)检测正在被探索。然而,肺癌是一种在多样化的患者群体中发生的生物学异质性疾病,这给识别稳健且可推广的分子特征带来了复杂性。现有的生物标志物方法通常在敏感性和特异性之间存在权衡,限制了其临床应用。 经典机器学习模型可能难以处理分子数据中存在的高维性和复杂的潜在非线性相互作用。量子和量子-经典混合机器学习方法为编码和处理此类数据提供了另一种框架,具有捕获更丰富特征表示的潜力。在本研究中,我们评估了用于早期肺癌检测的量子-经典混合模型,使用了两个cfDNA生物标志物数据集:一个基于\[5 (https://arxiv.org/html/2608.19304#bib.bib3),6 (https://arxiv.org/html/2608.19304#bib.bib4)\]开发的片段组学检测数据集,以及一个来自第二项发现级别研究的基于甲基化的特征数据集。 ## 2数据与方法 分析了源自旨在开发基于血液的肺癌筛查检测研究的两个数据集。 第一个数据集包含基于cfDNA甲基化的检测。该数据集包括通过甲基化敏感性限制性内切酶方法鉴定的56个基因组靶标的甲基化测量值。该队列包括813名参与一项病例对照生物标志物开发研究(目前尚未发表)的个体。所有参与者均符合基于年龄和吸烟史的标准肺癌筛查护理标准。其中,188名(23%)个体患有肺癌,其中150名(80%)处于I-III期。平均年龄为67岁。 第二个是一个公开可用的cfDNA片段组学数据集\[5 (https://arxiv.org/html/2608.19304#bib.bib3)\]。它包括来自718名个体的片段长度分布图。其中,365名在胸部影像学检查中有相关症状或可疑发现的个体在原始研究中用作训练队列。其余样本来自参加结直肠癌筛查试验的参与者,并补充了来自生物样本库的早期肺癌病例。具体而言,该数据集包括172名(24%)肺癌患者,其中99名(58%)处于I-III期。该队列的平均年龄为60岁。使用低覆盖度全基因组测序来推导cfDNA片段特征,计算为473个非重叠的5 Mb区域(每个区域包含约80,000个片段)中短片段与长片段的比例,覆盖了2.4 GB的基因组。 在两个数据集中,所有癌症(I-IV期)和对照组都被纳入最终分析。特征选择使用L1惩罚逻辑回归\[2 (https://arxiv.org/html/2608.19304#bib.bib8)\]进行。在训练数据内,特征经过标准化,并使用分层交叉验证拟合带有L1正则化的逻辑回归模型,正则化参数的选择旨在最大化接收者操作特征曲线下面积(AUC)。特征根据其模型系数的绝对值进行排序,并保留排名靠前的20个或40个特征用于下游建模。这些选定的特征随后被用作经典和量子核方法的输入。 ### 2.1量子核估计 我们实现了一个量子核估计(QKE)框架,用于从经典选择的特征构建非线性相似度矩阵。在QKE中,经典输入通过参数化特征映射嵌入到量子希尔伯特空间中,样本相似度由产生的量子态之间的保真度定义\[8 (https://arxiv.org/html/2608.19304#bib.bib5),3 (https://arxiv.org/html/2608.19304#bib.bib6)\]。这种公式通过量子电路隐式地诱导了一个非线性核,而下游分类则使用经典方法执行。 令\(\mathbf{x}_{i} \in \mathbb{R}^{d}\)表示样本\(i\)选定的特征向量,其中\(d \in \{20,40\}\)。特征使用在训练集上计算的统计数据缩放到\([0,\pi/2]\)区间: \[ \tilde{x}_{ij}=\frac{x_{ij}-\min(x_{j})}{\max(x_{j})-\min(x_{j})} \cdot \frac{\pi}{2}. \] 缩放参数仅在训练集上拟合,然后应用于验证集和留出测试集,以防止信息泄露。 独立评估了两种量子编码策略。在角度编码中,一个特征映射到一个量子比特,得到 \(n_{q}=d\)。在密集角度编码中,每个量子比特分配两个特征,得到 \(n_{q}=d/2\)。然后,每个缩放后的特征向量被编码为量子态 \(|\phi(\tilde{\mathbf{x}})\rangle = U_{\phi}(\tilde{\mathbf{x}};\theta)|0\rangle^{\otimes n_{q}}\),其中 \(\theta=\frac{\pi}{2}\)。特征映射由一个全局 \(R_{y}(\theta)\) 层、一个受控ZZ纠缠层和数据相关的单量子比特旋转组成。考虑了三种纠缠映射作为单独的实验配置:(i) 基于相关性排序的线性纠缠,(ii) 基于自定义评分的纠缠,以及(iii) 打乱的线性连接纠缠。基于相关性排序的线性纠缠使用皮尔逊相关性在固定的线性量子比特链内确定特征顺序,而基于自定义评分的纠缠使用皮尔逊相关性衍生的分数直接选择最强的量子比特对连接。作为对照,打乱的线性纠缠使用特征顺序随机打乱后的相同固定线性链,使我们能够评估基于相关性的排序是否改善了量子核表示。 对于角度编码,特征映射为 \[ U_{\mathrm{angle}}(\tilde{\mathbf{x}};\theta)=\left[\prod_{q=1}^{n_{q}}R_{z}^{(q)}(-2\tilde{x}_{q})\right]\left[\prod_{(q,r)\in\mathcal{E}}CZ_{q,r}\right]\left[\prod_{q=1}^{n_{q}}R_{y}^{(q)}(\theta)\right]. \] 对于密集角度编码,特征映射为 \[ U_{\mathrm{dense}}(\tilde{\mathbf{x}};\theta)=\left[\prod_{q=1}^{n_{q}}R_{z}^{(q)}(-2\tilde{x}_{2q+1})R_{x}^{(q)}(-2\tilde{x}_{2q})\right]\left[\prod_{(q,r)\in\mathcal{E}}CZ_{q,r}\right]\left[\prod_{q=1}^{n_{q}}R_{y}^{(q)}(\theta)\right]. \] 样本间的量子核定义为相应量子态的重叠模平方: \[ K(\mathbf{x}_{i},\mathbf{x}_{j})=\left\|\langle\phi(\tilde{\mathbf{x}}_{i})|\phi(\tilde{\mathbf{x}}_{j})\rangle\right\|^{2}. \] 这个保真度核是量子特征空间学习和基于保真度的量子核分类器中使用的标准量子核\[8 (https://arxiv.org/html/2608.19304#bib.bib5),3 (https://arxiv.org/html/2608.19304#bib.bib6)\]。在本工作中,核是通过精确态矢量模拟计算的,这可以实现量子特征空间相似度的精确估计。扩展到量子硬件将涉及有限采样和设备噪声,这可能影响核质量,将在未来工作中研究\[4 (https://arxiv.org/html/2608.19304#bib.bib7)\]。 令\(\mathbf{S}_{\mathrm{train}}\)和\(\mathbf{S}_{\mathrm{test}}\)分别表示训练样本和测试样本的模拟态矢量矩阵。核矩阵计算为: \[ \mathbf{K}_{\mathrm{train}}=\left\|\mathbf{S}_{\mathrm{train}}\mathbf{S}_{\mathrm{train}}^{\dagger}\right\|^{\circ 2},\qquad \mathbf{K}_{\mathrm{test}}=\left\|\mathbf{S}_{\mathrm{test}}\mathbf{S}_{\mathrm{train}}^{\dagger}\right\|^{\circ 2}. \] 训练核被对称化,其对角线被设置为1,所有元素被裁剪到\([0,1]\)区间以缓解数值不稳定性。 预计算的量子核被传递给两个下游分类器:一个直接在\(\mathbf{K}_{\mathrm{train}}\)上训练的支持向量机(SVM),以及一个在核主成分分析(KPCA)嵌入上训练的逻辑回归,数据按80/20的比例划分为训练集和留出测试集。作为经典比较器,一个单独的支持向量机在原始特征上训练,以反映与量子核一起使用的支持向量机,将核构建(经典 vs. 量子)作为唯一的比较变量;其核类型(线性、RBF、多项式、sigmoid)和超参数通过Optuna(TPE采样器)联合优化,以在分层5折交叉验证下最大化平均AUC。 图1:留出集和交叉验证性能。图中显示了经典SVM、量子核SVM和QPCA模型在不同特征选择、编码和纠缠配置下的AUC以及固定敏感度80%下的特异性。箱线图总结了10次重复运行下的留出集测试性能,而黑色菱形标记表示交叉验证估计值。 ## 3结果 ### 3.1 DNA甲基化数据集 在DNA甲基化数据集上的性能比较如图1 (https://arxiv.org/html/2608.19304#S2.F1)A-B所示。总体而言,使用前20个特征的经典SVM基线在评估的模型中取得了最高的留出集AUC,值集中在大约83-84%左右。量子核模型,包括SVM和KPCA分类器,取得了具有竞争力但通常较低的AUC值,在20特征配置下通常范围在大约80-82.5%之间。 在20特征的量子实验中,基于KPCA的模型通常比预计算核SVM取得了略高的AUC,特别是对于角度和密集角度编码方案。其中,密集角度线性配置产生了最强的AUC性能结果之一。相比之下,将选定特征从20个增加到40个并未一致提高性能。一些40特征的密集角度配置显示出AUC降低,在某些情况下降至大约79-80%,这表明额外特征可能引入了冗余、噪声或不太稳定的量子相似度结构。 如图1 (https://arxiv.org/html/2608.19304#S2.F1)B所示,特异性在重复的留出集评估中表现出比AUC更大的变异性。使用20个选定特征的经典SVM达到了集中在大约72-74%左右的特异性值,而40特征的变体显示出降低的特异性(大约65-67%)。在量子核模型中,KPCA在选定的40特征密集角度配置中表现出相对较强的特异性,达到大约75-78%,尽管变异性增加。预计算核SVM模型通常显示中等特异性,通常在65-71%范围内,具体取决于编码和纠缠配置。 总体而言,这些结果表明量子核模型可以达到与经典基线相竞争的性能,但其有效性对特征选择、编码策略和纠缠设计很敏感。在增加特征维度时缺乏一致的改进,表明在这种情况下,更大的特征集不一定能为量子核方法带来更好的泛化能力。 ### 3.2 cfDNA片段组学数据集 DNA片段组学数据集的相应结果如图1 (https://arxiv.org/html/2608.19304#S2.F1)C-D所示。与甲基化数据集相反,量子核模型在多个20特征配置中取得了持续强劲的AUC。大多数20特征量子实验产生了大约81-82%的AUC值,超过了经典SVM基线(该基线集中在大约78-79%附近)。这一趋势表明量子核表示捕获了片段组学特征空间中有用的非线性结构。 在AUC结果中,基于KPCA的模型经常是表现最佳的方法之一,特别是在……
相似文章
使用量子人工智能检测肺炎
慕尼黑大学(LMU)的研究人员开发了一种基于量子玻尔兹曼机(Quantum Boltzmann Machine)的模型,用于从胸部X光片中检测肺炎。该模型仅使用不到9000个参数(而传统卷积神经网络(CNN)需要数百万个参数),准确率达到84%至86%,展示了量子机器学习在处理小规模医疗数据集方面的潜在优势。
植物表型组学中小数据量子学习的监督潜在重构
本文提出了一种面向小数据场景下植物表型组学分类的混合量子-经典工作流,通过监督潜在重构(PCA+LDA)在量子核对齐前提升几何可分性。实验显示可分性有所提升,但揭示了压缩权衡以及实现强量子性能的困难。
LUNG-KGMM: 知识引导的多模态学习用于肺癌发生率预测
论文提出了LUNG-KGMM,一个知识引导的多模态框架,通过整合EHR、放射学数据和临床指南来预测肺癌发生率,在MIMIC数据集上展示了优越的性能,并进行了现实世界验证。
面向隐私保护联邦生物信号学习的混合量子启发式 Kolmogorov-Arnold 网络
本文介绍了一种用于隐私保护联邦 ECG 数据学习的混合量子启发式 Kolmogorov-Arnold 网络,与传统 MLP 相比,在减少参数和通信成本的同时,提高了分类指标。
通过混合专家模型的量子启发策略进行图像分类
提出了一种基于混合专家模型的量子启发式经典-量子混合框架用于图像分类,在MNIST和Fashion-MNIST数据集上展示了性能提升和错误率降低。