TT-net: 量子启发的张量网络在条件生成对抗网络中的去噪
摘要
TT-Net为条件生成对抗网络引入了一种量子启发的张量网络去噪模块,能够访问跨通道信息,在不同类型的噪声上,在PSNR和SSIM指标上优于SVD-Net和其他方法。
arXiv:2608.19789v1 公告类型:新
摘要:张量网络方法作为量子算法和量子多体系统经典模拟的主力工具,已进入量子物理学的科学主流。在各种类型的张量网络中,张量列车(在量子计算社区中通常称为矩阵乘积状态)已经在机器学习中找到了应用。这些方法通常依赖于一种强大的线性代数工具,称为奇异值分解(SVD)。一些用于图像去噪的条件生成对抗网络架构将SVD作为应用于生成器特征图的单次分解步骤。在这项工作中,我们引入了TT-Net,它用一种能够直接访问跨通道信息的双次张量列车分解替换了逐通道的SVD去噪模块,这种能力在当前替代方法中缺失。在仅在此分解机制上有所不同的受控比较中,TT-Net在PSNR和SSIM上优于SVD-Net,在所有测试的三种噪声类型(高斯、运动模糊和椒盐噪声)上,支持了跨通道访问能提高去噪质量的假设。训练动态分析进一步显示,TT-Net的对抗损失项在所有三种噪声类型上一致饱和到一个停滞状态,比SVD-Net的更明显,而重构质量无论如何都在继续提高,这提出了一个关于对抗部分贡献的开放问题,本研究识别但未解决。此外,对于高斯噪声,我们的方法优于EigenGAN和最先进的Pix2pix方法,后者不假设任何线性代数分解,也不保留任何线性代数信息。我们的手稿展示了如何将量子启发工具用作深度学习应用中的实用现实世界特征过滤器。
查看缓存全文
缓存时间: 2026/08/21 10:02
# 量子启发的条件生成对抗网络张量列去噪 来源:https://arxiv.org/html/2608.19789 Michal A. Sterzel∗, Marko J. Rančiㆠ卢森堡大学,科学、技术与传播学院,计算机科学系,Belval校区,丰特路6号,L-4364 Esch-Belval,Esch-sur-Alzette,卢森堡 ∗[email protected] †[email protected] ###### 摘要 张量网络方法最初是作为量子算法和量子多体系统经典模拟的强大工具而开发,现已在量子物理领域进入科学主流。在各种类型的张量网络中,张量列(在量子计算界通常称为矩阵乘积态)已在机器学习中找到了应用。这些方法通常依赖于一种强大的线性代数工具,称为奇异值分解。几种用于图像去噪的条件生成对抗网络架构将SVD作为应用于生成器特征图的单次切分解步骤。在这项工作中,我们引入了TT-Net,它将按通道的SVD去噪模块替换为两次切张量列分解,能够直接访问跨通道信息,这是当前替代方案所缺乏的能力。在仅分解机制不同的受控比较中,TT-Net在所有三种测试噪声类型(高斯噪声、运动模糊和椒盐噪声)下的PSNR和SSIM均优于SVD-Net,支持了跨通道访问可提高去噪质量的假设。训练动力学分析进一步表明,TT-Net的对抗损失项在所有三种噪声类型下都持续饱和至停滞状态,比SVD-Net更为显著,而重构质量无论是否如此都在持续提升,这提出了一个关于对抗组件贡献的开放性问题,本研究识别但未解决。此外,对于高斯噪声,我们的方法优于EigenGAN和先进的Pix2pix方法,后者不假设任何线性代数分解且不保留任何线性代数信息。本文展示了如何将量子启发工具用作深度学习应用中实用的现实世界特征过滤器。 ## 1引言 量子计算是一种新型计算范式,预计将在计算世界带来下一次颠覆。随着硬件成熟,“杀手级应用”的探索正在全面展开。模拟越来越大规模量子电路的需求催生了张量网络领域,其中最常用的网络子类型被称为张量列,在量子物理文献中通常被称为矩阵乘积态[7 (https://arxiv.org/html/2608.19789#bib.bib7)]。 从降质版本恢复干净图像的任务被称为图像去噪,这是图像处理中的一个长期问题,应用范围从医学成像、遥感到消费摄影,每个领域都提高了下游数据分析的可靠性。生成对抗网络[2 (https://arxiv.org/html/2608.19789#bib.bib3)]已以其条件形式被广泛用于此任务,其中生成器被训练将降质图像转换为其干净对应图像,而判别器提供对抗反馈,通常比依赖于对噪声或图像结构的固定假设的经典去噪方法能更好地保留细节。 在此背景下,一些架构将奇异值分解作为生成器的组成部分,以不同角色使用它:如EigenGAN[5 (https://arxiv.org/html/2608.19789#bib.bib1)]中,将生成特征图的奇异值向目标调整;或如SVD-Net[8 (https://arxiv.org/html/2608.19789#bib.bib2)]中,将其用作按通道的过滤机制。然而,在每种情况下,SVD都作为单次分解步骤应用:特征图被展开为一个矩阵并分解一次。由于卷积特征图本质上是三轴对象(通道、高度和宽度),单次SVD切割只能将其中一个轴组(例如通道与合并的空间维度)从其余部分分离,而在该展开中合并的轴无法再分别检查。 这引出了一个自然的问题:将单次SVD切割推广为一系列切割(称为张量列分解),会改变此类去噪机制能捕获或丢弃什么吗?张量分解方法先前已被应用于神经网络架构内部,包括生成对抗网络[1 (https://arxiv.org/html/2608.19789#bib.bib4), 6 (https://arxiv.org/html/2608.19789#bib.bib5)],但仅用于压缩学习的权重矩阵,从未用于按样本过滤特征图激活,也从未用于去噪背景(第2节 [https://arxiv.org/html/2608.19789#S2])。 本文介绍了TT-Net,一种受矩阵乘积态启发的方法,它用两次切张量列分解替换了SVD-Net的按通道SVD去噪模块[8 (https://arxiv.org/html/2608.19789#bib.bib2)],该模块插入在生成器中的相同位置并在相同的训练条件下评估,将分解机制隔离为唯一关注的变量。我们的贡献是:(1) 一个张量列去噪模块,与SVD-Net不同,它允许分解直接访问跨通道结构;(2) 一种自适应的每次切割阈值方案,保持与SVD-Net相当的整体保留能量目标,实现公平的、逐项对比的比较;(3) 在三种不同噪声类型下,对TT-Net与SVD-Net、EigenGAN以及非SVD的Pix2pix基线进行的实验比较。 ## 2相关工作 几种用于图像去噪的条件生成对抗网络架构以不同角色集成了SVD。EigenGAN[5 (https://arxiv.org/html/2608.19789#bib.bib1)]在生成器的解码器内应用SVD,将生成特征图的奇异值向目标图像调整,并将它们的差值作为显式损失项,使其对SVD的使用是监督和目标感知的。SVD-Net[8 (https://arxiv.org/html/2608.19789#bib.bib2)],即本工作的直接前身,则纯粹将SVD用作过滤机制:在每个编码器下采样阶段后,每个特征图通道独立通过SVD分解,仅保留保持该通道固定能量分数θ=0.9所需的奇异值,不与目标比较,也没有专用的损失项。 张量分解方法则被单独用于压缩生成和一般神经网络架构的参数。1 (https://arxiv.org/html/2608.19789#bib.bib4)用基于Tucker分解的张量层替换了生成对抗网络的全连接层,在对样本质量影响有限的情况下实现了大量的参数压缩。6 (https://arxiv.org/html/2608.19789#bib.bib5)类似地以张量列格式表示全连接层权重矩阵,报告了几个数量级的压缩因子。这两种方法都分解一次学习的权重矩阵,得到的核心通过端到端训练。两者都没有按样本对特征图激活应用张量分解,也没有在去噪背景下进行评估。 这就留下了一个空白:目前没有工作将在SVD-Net中使用的单次切割、基于SVD的激活过滤器替换为应用于相同架构角色的多次切割张量列分解。接下来介绍的TT-Net直接解决了这个空白。 ## 3方法 ### 3.1 SVD-Net 回顾 SVD-Net的去噪模块独立分解特征图的每个通道:对于形状为通道×高度×宽度的特征图,SVD分别应用于每个通道自身的高度×宽度矩阵,保留足够多的奇异值以在重构前保持该通道固定分数θ=0.9的能量。由于没有两个通道出现在同一个矩阵中,无论选择什么阈值,此机制都无法比较通道之间或利用它们之间的任何关系。 ### 3.2 TT-Net 架构 TT-Net用两次切张量列分解替换了SVD-Net的按通道SVD,该模块插入在生成器中的相同三个位置(在每个编码器下采样阶段之后)(表1 [https://arxiv.org/html/2608.19789#S3.T1]),并重构一个过滤后的特征图,其传递方式与SVD-Net的完全相同。 表 1:TT-Net / SVD-Net 每个插入点处的特征图形状。对于单个图像的特征图X∈RC×H×W,第一次切割将X重塑为M1∈RC×(HW),保持通道作为其自身轴,同时合并高度和宽度。SVD直接应用于M1=U1Σ1V1T,使得给定图像的所有通道作为同一矩阵的行,并在分解过程中彼此比较,这是SVD-Net所缺乏的能力。按保留能量排序的前χ1分量(第3.3节 [https://arxiv.org/html/2608.19789#S3.SS3])构成Core1=U1[:,1:χ1]。相应的余量R1=Σ1[1:χ1,1:χ1]V1T[1:χ1,:]被向前传递,而不是立即重构,而超过χ1的分量则被完全丢弃。 R1被重塑,使通道与高度合并,得到M2∈R(χ1H)×W,第二次SVD M2=U2Σ2V2T产生自适应选择的χ2,得到Core2∈Rχ1×H×χ2(从U2[:,1:χ2]重塑而来)和Core3=Σ2[1:χ2,1:χ2]V2T[1:χ2,:]∈Rχ2×W。过滤后的特征图通过收缩所有三个核心来重构: X~[i,j,k]=∑a=1χ1∑b=1χ2Core1[i,a]Core2[a,j,b]Core3[b,k]. 架构的所有其他部分,如生成器/判别器结构、损失函数、优化器和训练过程,都与SVD-Net相同,将分解机制隔离为唯一研究的变量。 ### 3.3 用于公平比较的自适应阈值 两个模型都按图像自适应地选择其保留秩,即累积平方奇异值能量达到阈值θ的最小χ,而不是预先固定χ。由于TT-Net的第二次切割操作于从第一次传递的余量,其两个阈值是相乘而非相加:设置θ1=θ2=0.9将导致整体保留能量接近0.9²=0.81,而不是0.9。为了保持与SVD-Net的单一θ=0.9目标公平比较,TT-Net的阈值相应设置为θ1=θ2=√0.9≈0.9487,使得θ1×θ2≈0.9。由于χ被选择为足够大的最小值且奇异值是离散的,实际保留能量通常超过标称阈值。 ### 3.4 获得的跨通道信息 两次切割提取了结构上不同的信息。第一次切割的主导方向(最大奇异值)对应于通道间最强的一致模式,而较小奇异值方向捕获特定于通道的残差变化。仅保留主导方向保留了通道共享的内容,同时丢弃了各通道独有的信息,这是按通道分解完全无法访问的信息。第二次切割,以宽度作为唯一自由轴操作于第一次保留的内容,而是捕获在保留的通道方向和高度位置上共同分享的水平空间规律性(例如平滑梯度、重复纹理、边缘)。丢弃在任一切割中被排除的内容是去除噪声还是真实细节,是第5节 [https://arxiv.org/html/2608.19789#S5]解决的实证问题。 ## 4实验设置 所有实验使用CIFAR-10数据集,调整为64×64像素,并分为40,000张训练图像、10,000张验证图像和10,000张测试图像。对数据集应用三种合成噪声类型,以生成用于有监督训练的降质-干净对,所有四个模型应用方式相同:标准差为0.5的加性高斯噪声、使用11像素方向核在45°方向的运动模糊、以及影响20%像素的椒盐噪声。 所有模型训练50个周期。评估使用峰值信噪比和结构相似性指数[3 (https://arxiv.org/html/2608.19789#bib.bib8)]在保留的测试集上进行,所有四个模型计算方式相同。SSIM使用标准窗口化公式(11x11高斯窗口,sigma=1.5)计算,与原始定义一致,所有四个模型计算方式相同。 ### 4.1 优化的超参数 表 2:每个模型使用的优化超参数,统一应用32的批量大小。表2 [https://arxiv.org/html/2608.19789#S4.T2]列出了所有模型训练中使用的超参数。尽管进行了按模型调整,但有一个超参数有意在四个模型间统一:批量大小,在所有模型和每种噪声类型中固定为32。保持批量大小固定为32,同时保留每个模型文献推荐的学习率和动量,将批量大小隔离为整个比较中唯一标准化的超参数。 每个模型的优化器设置遵循其各自原始论文中的配置:Pix2pix和EigenGAN的值直接来自4 [https://arxiv.org/html/2608.19789#bib.bib6]和5 [https://arxiv.org/html/2608.19789#bib.bib1],SVD-Net的来自8 [https://arxiv.org/html/2608.19789#bib.bib2]。TT-Net没有自己独立的原始论文可参考,因为它是在本工作中引入的;与其选择新的、未经测试的配置,TT-Net反而直接采用SVD-Net的精确优化器设置。此选择直接源于TT-Net被设计为SVD-Net的直接架构扩展(第3节 [https://arxiv.org/html/2608.19789#S3]),仅在去噪模块上有所不同:使用SVD-Net自身推荐的配置,使该比较成为单变量消融研究,将分解机制隔离为两个模型之间的唯一差异,而不是在此基础上引入额外的、独立调整的超参数差异。 ### 4.2 实现细节 除声明的超参数外,四个模型在判别器设计和重构损失上也存在架构差异。SVD-Net和TT-Net共享一个使用交叉熵损失训练的无条件判别器,以及一个使用混合MSE和MS-SSIM(δ=0.84)的重构损失的生成器。具体来说,对于生成的图像Ŷ和其干净目标Y,两个重构项是逐像素均方误差 L L2 = ‖Ŷ - Y‖²₂,
相似文章
U-TTT:通过测试时训练实现可泛化的PET图像去噪
本文介绍了U-TTT,一种带有测试时训练层和双域适配的U型深度学习模型,用于在分布偏移下实现鲁棒的PET图像去噪,在不同剂量水平和扫描仪类型上均达到了最先进性能。
面向真实世界时间序列的量子生成扩散模型
QDiffusion-TS是首个针对真实世界时间序列合成的量子生成扩散模型,它用量子神经网络替换了去噪Transformer中的前馈组件。该模型将可训练参数减少了近三个数量级,并在金融数据上将Wasserstein距离改进了44%,在下游预测任务中RMSE最高提升71%。
使用最优传输改进 GANs
OT-GAN 提出了一种新颖的 GAN 变体,在对抗学习的特征空间中结合最优传输和能量距离,以提高训练稳定性和图像生成质量。该方法在基准问题上展示了最先进的结果,使用大批量数据实现了稳定的训练。
SQS:通过稀疏量化子分布的贝叶斯深度神经网络压缩
论文介绍了一个统一的贝叶斯变分框架,结合 spike-and-slab 稀疏性和高斯混合量化,用于在大神经网络中实现高压缩率,同时最小化精度损失。
TriHead-GAN:一种具有三头判别器的生成对抗网络,用于碳排放时间序列生成
提出了TriHead-GAN,一种基于Transformer的GAN,其采用三头判别器,联合监督分布真实性、跨变量依赖性和时间平滑性,以生成逼真的碳排放时间序列,在多个数据集上优于基线方法。