PQFA:针对多模态分类的融合表示并行量子特征增强
摘要
提出并行量子特征增强(PQFA),这是一种混合量子-经典框架,应用浅层变分量子电路来增强融合的多模态特征,以更少的参数超越经典基线。
arXiv:2607.13466v1 公告类型:新
摘要:大多数多模态学习方法致力于改进异构表示的对齐与融合,而融合后的增强则较少被探索。我们提出并行量子特征增强(PQFA),这是一种混合量子-经典框架,对融合后的多模态特征应用多个浅层变分量子电路。通过冻结的RoBERTa和ViT编码器提取的文本和图像表示,经过双向交叉注意力、注意力池化和自适应门控融合处理。然后,融合特征被幅度编码到并行量子电路中,其测量读数与经典表示拼接以进行预测。我们在MM-IMDb和N24News上通过使用相同的编码器、融合骨干、数据划分、投影维度和增强输出宽度的受控比较来评估PQFA。PQFA始终优于未使用量子增强的融合骨干和宽度匹配的MLP增强基线,同时使用约2.2K的增强参数,而MLP分支为24.0K。缺失模态实验进一步表明,当文本或视觉输入不完整时,鲁棒性提高,尤其是当信息更丰富的文本模态严重退化时,增益尤为明显。受控消融和特征空间分析表明,这种改进无法通过随机特征映射、增加经典宽度或未经训练的量子变换来重现。量子态诊断还显示,在测试的模拟噪声水平下,预测性能稳定,且编码状态具有明显的分支特定变换。这些结果确立了PQFA作为一种高效参数的后融合增强策略,用于混合量子-经典多模态学习。
查看缓存全文
缓存时间: 2026/07/16 04:22
# PQFA:面向多模态分类的并行量子特征增强融合表示源:https://arxiv.org/html/2607.13466 ###### 摘要 大多数多模态学习方法侧重于改进异构表示的对齐与融合,而融合后增强的研究相对较少。我们提出并行量子特征增强(Parallel Quantum Feature Augmentation, PQFA),这是一种混合量子-经典框架,将多个浅层变分量子电路应用于融合后的多模态特征。通过冻结的RoBERTa和ViT编码器提取的文本与图像表示,经过双向交叉注意力、注意力池化和自适应门控融合处理。融合后的特征被幅度编码到并行量子电路中,其测量读出结果与经典表示拼接后用于预测。我们在MM-IMDb和N24News数据集上,通过控制相同的编码器、融合主干、数据划分、投影维度和增强输出宽度进行对比实验。PQFA始终优于无量子增强的融合主干以及宽度匹配的MLP增强基线,且其增强参数仅约2.2K,而MLP分支则需24.0K参数。缺失模态实验进一步表明,当文本或视觉输入不完整时,模型鲁棒性得到提升,尤其当信息量更丰富的文本模态严重退化时,增益更为明显。控制消融实验和特征空间分析表明,随机特征映射、增加经典宽度或未经训练的量子变换均无法复现这种改进。量子态诊断进一步显示,在测试的模拟噪声水平下,模型预测性能稳定,且编码态存在分支特定的不同变换。这些结果确立了PQFA作为一种高效且参数经济的后融合增强策略,用于混合量子-经典多模态学习。 ###### 关键词: 多模态融合, 量子机器学习, 参数化量子电路, 特征增强, 缺失模态 \\affiliation [1]organization=中国科学院数学与系统科学研究院, city=北京, postcode=100190, country=中国\\affiliation[2]organization=中国科学院大学数学科学学院, city=北京, postcode=100049, country=中国\\affiliation[3]organization=中国科学院数学与系统科学研究院 数学国家重点实验室, city=北京, postcode=100190, country=中国 ## 1 引言 多模态分类要求模型整合来自不同来源的异构信息,例如文本和图像。现代多模态模型通常依赖预训练编码器和中间融合模块,在预测之前对齐模态特定的表示[1 (https://arxiv.org/html/2607.13466#bib.bib1),2 (https://arxiv.org/html/2607.13466#bib.bib2)]。尽管这些经典融合架构是有效的,但融合后的表示可能仍然受益于轻量级的后融合变换,这些变换能够丰富对预测有用的特征,而无需大幅增加整个模型的深度或规模。与改善融合阶段本身的大量文献相比,对已融合表示进行操作的后融合增强模块仍相对未被充分探索。此外,此类模块的贡献必须与底层融合主干的贡献仔细区分开来。 参数化量子电路为这种后融合特征变换提供了一种可能的机制。变分量子电路可以将经典向量编码为量子态,应用可训练酉变换,并返回测量期望值作为非线性读出特征[3 (https://arxiv.org/html/2607.13466#bib.bib3),4 (https://arxiv.org/html/2607.13466#bib.bib4),5 (https://arxiv.org/html/2607.13466#bib.bib5)]。然而,当前的含噪中等规模量子(NISQ)设置对量子比特数量、电路深度、有限采样噪声和可训练性施加了实际约束[6 (https://arxiv.org/html/2607.13466#bib.bib6),7 (https://arxiv.org/html/2607.13466#bib.bib7),8 (https://arxiv.org/html/2607.13466#bib.bib8)]。这些约束使得用大型量子模型取代成熟的深度多模态架构变得不切实际。对于近期的设置,更合适的做法是将量子电路视为经典流水线中的浅层辅助模块。 现有的量子或量子启发的多模态研究探索了量子融合模块、量子增强情感分析以及用于多模态任务的混合神经架构[9 (https://arxiv.org/html/2607.13466#bib.bib9),10 (https://arxiv.org/html/2607.13466#bib.bib10),11 (https://arxiv.org/html/2607.13466#bib.bib11),12 (https://arxiv.org/html/2607.13466#bib.bib12)]。然而,现有研究并不总是清晰地分离量子组件的架构角色和贡献。许多设计分别处理单模态特征,或将量子模块作为序列块插入,这使得难以判断量子组件是否改进了已集成的跨模态表示。此外,报告的性能增益常常与特征维度的增加、额外可训练参数或经典融合主干的改变纠缠在一起。这种区分很重要,因为混合量子-经典多模态模型中的性能提升可能有多种原因:可能源于更好的融合策略、更强的预训练编码器、更大的最终表示,或者仅仅是更多的可训练参数。如果没有一个移除量子电路的融合主干和一个宽度匹配的经典增强基线,就很难将改进明确归因于量子读出分支。因此,对量子增强多模态融合的有意义评估应该控制经典融合路径,并将量子模块与相同输出宽度的经典模块进行比较。 除了整体性能之外,检查生成增强特征的几何结构也很有用。比较PCA谱、有效维度和结构修改的增强分支,有助于区分任务对齐的特征变换与通用宽度扩展或随机非线性特征生成。 为了解决这个问题,我们提出了并行量子特征增强(PQFA)。核心思想不是替换经典多模态融合模块,而是在跨模态交互已经执行之后,对融合后的表示进行增强。多模态输入首先由冻结的预训练编码器编码,然后通过双向交叉注意力精炼,通过注意力池化汇总,并通过自适应门控融合整合。得到的融合特征随后被并行幅度编码到几个浅层变分量子电路中。它们的测量读出结果与经典融合特征拼接,用于最终预测。 本工作的主要贡献总结如下: - 1. 我们引入了PQFA,一种后融合量子增强框架,它将浅层并行变分量子电路应用于集成的多模态表示,而不是原始或独立处理的单模态特征。 - 2. 我们开发了一种受控的混合架构,其中预训练编码器和经典融合路径在PQFA、无量子主干和经典增强基线中保持不变。这种设计增强了性能差异归因于增强模块的可靠性。 - 3. 我们在MM-IMDb和N24News上证明,PQFA改善了多标签和单标签分类,同时使用的增强参数显著少于宽度匹配的MLP分支。额外的控制将学习到的量子变换与通用特征扩展、增加的经典容量和随机量子映射区分开来。 - 4. 我们通过缺失模态实验、配对误差转换分析、特征空间诊断、模拟噪声评估、纠缠分析和门权重分析,在整体预测指标之外评估了PQFA。这些分析表征了其鲁棒性、决策级行为和表示特性。 本文的其余部分组织如下。第2节 (https://arxiv.org/html/2607.13466#S2) 回顾了经典多模态融合、混合量子-经典学习以及量子增强多模态模型。第3节 (https://arxiv.org/html/2607.13466#S3) 介绍了PQFA架构。第4节 (https://arxiv.org/html/2607.13466#S4) 描述了实验设置,并报告了主要结果和诊断分析。第5节 (https://arxiv.org/html/2607.13466#S5) 讨论了启示和未来的研究方向。第6节 (https://arxiv.org/html/2607.13466#S6) 总结全文。 ## 2 相关工作 本节回顾与本研究最相关的三个研究方向:经典多模态融合、量子机器学习与混合量子-经典模型,以及量子或量子启发的多模态融合。 ### 2.1 经典多模态融合 多模态融合旨在将异构信息源整合成一个统一的表示,用于预测和决策。现有策略通常根据模态是在输入层、表示层还是决策层进行组合,分为早期融合、中间融合和晚期融合[13 (https://arxiv.org/html/2607.13466#bib.bib13),14 (https://arxiv.org/html/2607.13466#bib.bib14)]。早期融合简单,但可能对特征尺度不匹配和模态异质性敏感;而晚期融合保留了模态特定的路径,但可能未能充分利用细粒度的跨模态交互[13 (https://arxiv.org/html/2607.13466#bib.bib13),14 (https://arxiv.org/html/2607.13466#bib.bib14)]。因此,中间融合已成为深度多模态学习中广泛采用的范式,因为它允许在模态特定表示之间进行显式对齐和交互[14 (https://arxiv.org/html/2607.13466#bib.bib14),2 (https://arxiv.org/html/2607.13466#bib.bib2)]。 一条主要的研究方向侧重于在控制计算成本的同时增加跨模态交互的表达能力。低秩和分解方法通过模态特定因子近似高阶融合张量[15 (https://arxiv.org/html/2607.13466#bib.bib15)]。在视觉-语言学习中,多模态因子化双线性池化和多模态Tucker融合进一步使用紧凑的双线性或张量分解来建模乘性图像-文本交互[16 (https://arxiv.org/html/2607.13466#bib.bib16),17 (https://arxiv.org/html/2607.13466#bib.bib17)]。其他方法学习共享和模态特定的因子,最大化跨模态相关性,或在预测前迭代精炼单模态表示[18 (https://arxiv.org/html/2607.13466#bib.bib18),19 (https://arxiv.org/html/2607.13466#bib.bib19)]。基于Transformer的模型则使用自注意力、交叉注意力和注意力瓶颈在标记、图像补丁和模态特定潜在特征之间交换信息[20 (https://arxiv.org/html/2607.13466#bib.bib20),21 (https://arxiv.org/html/2607.13466#bib.bib21),2 (https://arxiv.org/html/2607.13466#bib.bib2)]。动态门控和耦合状态空间模型进一步根据输入调整每个模态的贡献或交互模式[22 (https://arxiv.org/html/2607.13466#bib.bib22),23 (https://arxiv.org/html/2607.13466#bib.bib23)]。 这些发展与图像-文本分类直接相关,其中交叉注意力可以建立语义对应关系,自适应门控可以调节文本和视觉表示的相对贡献[2 (https://arxiv.org/html/2607.13466#bib.bib2),22 (https://arxiv.org/html/2607.13466#bib.bib22)]。鲁棒性研究也表明,多模态Transformer可能对缺失输入敏感,并且融合策略的效果可能取决于数据集和缺失模态模式[24 (https://arxiv.org/html/2607.13466#bib.bib24)]。 然而,这些文献中的大多数旨在改进编码器、交互机制或融合算子本身。相比之下,较少关注保持一个固定的、强大的融合主干,并探究额外的轻量级变换能否改善已融合的表示。这种区别激发了本工作中考虑的后融合设置,并支持与未增强的融合主干以及宽度匹配的经典增强模块进行比较。 ### 2.2 量子机器学习与混合量子-经典模型 量子机器学习研究如何使用量子态、测量和可训练量子操作进行表示、学习和预测[3 (https://arxiv.org/html/2607.13466#bib.bib3),4 (https://arxiv.org/html/2607.13466#bib.bib4)]。对于近期应用,参数化量子电路(PQCs),也称为变分量子电路,通常嵌入在混合量子-经典优化循环中[25 (https://arxiv.org/html/2607.13466#bib.bib25),7 (https://arxiv.org/html/2607.13466#bib.bib7)]。一个典型的基于PQC的学习模型将经典数据编码为量子态,应用可训练酉变换,并将测量期望值转换为特征或预测输出[4 (https://arxiv.org/html/2607.13466#bib.bib4),5 (https://arxiv.org/html/2607.13466#bib.bib5)]。这个框架推动了量子核、变分分类器、量子神经网络以及其他用于监督学习和表示学习的混合模型的发展[5 (https://arxiv.org/html/2607.13466#bib.bib5),26 (https://arxiv.org/html/2607.13466#bib.bib26),27 (https://arxiv.org/html/2607.13466#bib.bib27)]。 PQCs的吸引力在于它们能够通过数据编码、纠缠操作和可观测量测量来实现结构化的非线性特征映射[4 (https://arxiv.org/html/2607.13466#bib.bib4),5 (https://arxiv.org/html/2607.13466#bib.bib5)]。然而,它们的实际使用受到加载经典数据的成本、有限的量子比特数量和连接性、有限的电路深度、采样噪声以及硬件错误的限制[6 (https://arxiv.org/html/2607.13466#bib.bib6),7 (https://arxiv.org/html/2607.13466#bib.bib7)]。当电路过深、初始化不当或受噪声影响时,优化也可能恶化,这体现在贫瘠高原和噪声诱导可训练性分析中[8 (https://arxiv.org/html/2607.13466#bib.bib8),28 (https://arxiv.org/html/2607.13466#bib.bib28),29 (https://arxiv.org/html/2607.13466#bib.bib29)]。这些限制使得在当前设置下用大型量子模型完全取代成熟的深度神经网络变得不现实。 因此,近期的工作越来越多地将量子组件视为较大经典系统内的模块,而不是独立的替代品。这些组件已被用作紧凑的特征变换、分类器头部、局部量子滤波器或自适应结构的电路块[30 (https://arxiv.org/html/2607.13466#bib.bib30),31 (https://arxiv.org/html/2607.13466#bib.bib31),27 (https://arxiv.org/html/2607.13466#bib.bib27)]。同时,受控基准测试强调了需要将量子模型与适当调整的经典基线进行比较,并将架构变化与量子组件本身的效果分开[32 (https://arxiv.org/html/2607.13466#bib.bib32),27 (https://arxiv.org/html/2607.13466#bib.bib27)]。这种受控的视角
相似文章
QUIVER:量子信息视图增强大型机器学习模型的表示
本文介绍了QUIVER,一种通过从量子费舍信息矩阵中提取的量子启发特征来丰富经典机器学习模型的范式,并在分子属性预测和喷注味分类基准上展示了改进效果。
通过混合专家模型的量子启发策略进行图像分类
提出了一种基于混合专家模型的量子启发式经典-量子混合框架用于图像分类,在MNIST和Fashion-MNIST数据集上展示了性能提升和错误率降低。
植物表型组学中小数据量子学习的监督潜在重构
本文提出了一种面向小数据场景下植物表型组学分类的混合量子-经典工作流,通过监督潜在重构(PCA+LDA)在量子核对齐前提升几何可分性。实验显示可分性有所提升,但揭示了压缩权衡以及实现强量子性能的困难。
QUADS:通过量化误差双侧对齐稳定MoE的NVFP4强化学习
本文提出QUADS,一种通过对齐训练端和推理生成端的量化误差来稳定混合专家大语言模型的NVFP4强化学习的方法,实现了BF16级别的精度,并且吞吐量高于FP8。
用于神经主题建模的混合经典-量子变分自编码器
本文提出了一种用于神经主题建模的混合经典-量子变分自编码器,在推理网络中嵌入了参数化量子电路。在AgNews数据集上的实验表明,与最先进的经典模型相比,主题连贯性和多样性有所提高,显示了在NISQ时代量子设备上的可行性。