正交树突内在网络:一种用于重要性排序的正交潜在空间的架构
摘要
本文介绍了ODIN,一种新颖的自编码器架构,它强制潜在维度正交并按照重要性排序,在全非线性条件下恢复类似PCA的可解释性。该方法将几何约束集成到训练目标中,具有理论依据,并在合成数据集和真实数据集上进行了实证验证。
arXiv:2607.05653v1 公告类型:新
摘要:主成分分析(PCA)或类似PCA的特性(正交性、方差排序)在深度自编码器架构中很少实现。在本工作中,我们提出了ODIN(正交树突内在网络),一种新颖的自编码器架构,在全非线性情况下恢复类似PCA的潜在结构。通过将一组几何约束直接纳入训练目标,ODIN鼓励潜在维度相互正交并按解释方差排序,模仿PCA的可解释分解,同时保留深度网络的表达能力。我们为这些约束提供了理论基础,并证明了它们与标准编码器-解码器框架的兼容性。我们还对合成数据集和真实数据集建立了实证结果,为可解释、结构化的特征学习和降维提供了一条原则性的路径。
查看缓存全文
缓存时间: 2026/07/08 04:44
# 一种基于重要性排序的正交潜在空间架构 来源:https://arxiv.org/html/2607.05653 ## 正交树突内在网络:一种基于重要性排序的正交潜在空间架构 \\nameJeanie Schreiber\\emailjschrei@gmu\.edu \\addr数学科学系,乔治梅森大学,费尔法克斯,弗吉尼亚州 22030,美国\\nameTyrus Berry\\emailtberry@gmu\.edu \\addr数学科学系,乔治梅森大学,费尔法克斯,弗吉尼亚州 22030,美国\\nameZeeshan Ahmed\\emailzeeshan\.ahmed@nist\.gov \\addr传感器科学部,物理测量实验室,NIST,盖瑟斯堡,马里兰州 20899,美国 ###### 摘要 主成分分析(PCA)类特性(正交性、方差排序)在深度自动编码器架构中很少实现。本文提出 ODIN(正交树突内在网络),一种新颖的自动编码器架构,能够在完全非线性机制下恢复 PCA 类潜在结构。通过将一组几何约束直接融入训练目标,ODIN 鼓励潜在维度相互正交并按解释方差排序,在保持深度网络表达能力的同时,镜像 PCA 的可解释分解。我们为这些约束提供了理论依据,并证明了它们与标准编码器-解码器框架的兼容性。我们还针对合成和真实世界数据集建立了实证结果,为可解释的结构化特征学习和降维建立了一条有原则的路径。 关键词:自动编码器,PCA,非线性 PCA,降维,特征学习,可解释机器学习 ## 1 引言 传统的自动编码器由编码器和解码器组成,将数据压缩到较低维度的潜在空间,然后解码器尝试从潜在表示重建原始输入。损失函数通常基于重建误差,驱动模型学习有效的潜在嵌入,编码数据的重要特征。虽然有效,但标准自动编码器架构未对潜在空间施加结构约束,通常利用整个潜在表示进行推理和理解。由于缺乏排序或可分离性的概念,所得特征均匀地分布在潜在空间中,使得解释哪些潜在维度对应有意义的输入特征变得具有挑战性。潜在空间组织的固有歧义是应用自动编码器进行降维时的常见挑战。传统的自动编码器架构产生的潜在表示具有纠缠、非正交的方向,这些方向在不同训练运行中不可预测地变化。这种不稳定性使可重复性和解释性都变得复杂。 正交树突内在网络(ODIN)架构通过受生物学启发的关键创新解决了这些局限性。首先,ODIN 采用树突结构,强制执行潜在维度的层次重要性排序。通过限制解码器仅访问潜在变量的累积子集(例如,仅前 k 个组分),网络学会优先考虑在逐步累加时最大化重建保真度的方向。此外,通过学习函数中的几何约束强制执行严格的潜在空间正交性,确保跨训练会话的一致轴对齐。这些机制共同强制执行正交且重要性排序的潜在维度,在保持神经网络的非线性表达能力的同时镜像 PCA 的特征值排序。关键的是,ODIN 完全以无监督方式实现这种解缠,不同于需要标记数据或预定义特征层次的方法。正交化的潜在方向分离了输入数据的内在属性,对应统计上独立的变异模式,使研究人员能够: 1. 1. 通过方差排序的潜在维度识别主要变异模式。 2. 2. 通过系统移除较不重要的轴进行稳定的特征消融研究。 3. 3. 实现跨独立训练运行的可重复潜在分配,使用一致的潜在空间坐标系进行可靠的跨实验比较。 对于 AI 可解释性,ODIN 的架构在原始数据和潜在表示之间创建了一个可解释的桥梁。正交化的维度允许通常保留给 PCA 的线性分解分析,而非线性编码则保留了线性方法可能遗漏的复杂关系。这种双重能力使 ODIN 在需要模型透明度和高维模式识别的领域特别有价值,例如生物医学信号处理或材料科学表征。 ## 2 背景 自动编码器是降维的强大工具,在捕捉传统 PCA 无法捕捉的非线性模式方面提供了灵活性。Liet al.(2023 (https://arxiv.org/html/2607.05653#bib.bib13)) 对自动编码器架构及其变体的全面综述突显了该领域进步的广度。然而,该综述提到一个显著差距:大多数自动编码器设计并未尝试复制 PCA 的关键特征,如正交性和基于方差的潜在空间组分排序。这些属性对于可解释性和系统特征提取至关重要,但它们在自动编码器研究中仍基本未被解决。 Plaut (2018 (https://arxiv.org/html/2607.05653#bib.bib5)) 严格建立了线性自动编码器与 PCA 之间的基本联系,他证明了单隐藏层线性自动编码器跨越的主子空间等价于 PCA 载荷向量。然而,正如 PCA 解仅在正交变换下唯一一样,梯度下降可以收敛到多个等价子空间,这些子空间都实现相同的最小重建误差。此外,当引入非线性激活函数时,这种等价性完全破裂,留下了一个问题:如何在深度架构中保持 PCA 类可解释性。 核 PCA 可被视为 PCA 到非线性数据的最自然扩展,通过核变换而非激活函数。核 PCA 将数据投影到更高维空间,其中非线性模式变为线性,使得能够实现类似 PCA 的基于方差的排序,同时适应复杂关系 (Pei and others (2018 (https://arxiv.org/html/2607.05653#bib.bib14)); Majumdar (2021 (https://arxiv.org/html/2607.05653#bib.bib15)); Pei (2017 (https://arxiv.org/html/2607.05653#bib.bib16)))。尽管在处理非线性数据方面有效,但核 PCA 缺乏自动编码器的生成能力,并且需要显式选择核函数,限制了其在不同数据集上的适应性。 最近在 PCA 类降维的神经实现方面的进展揭示了将非线性表达能力与结构化潜在空间相结合时存在的持续挑战。Ren et al.(2024 (https://arxiv.org/html/2607.05653#bib.bib3)) 开发了一种使用 Cayley 变换强制潜在空间正交性的自动编码器架构,实现了与核 PCA 相当的非线性特征提取。Wang et al.(2019 (https://arxiv.org/html/2607.05653#bib.bib4)) 的并行工作通过损失函数正则化引入了正交约束,最小化了潜在向量相关性与单位矩阵之间的差异。虽然这些方法成功地将内在数据属性分离到不同的潜在组分中,并且可以有效地用于聚类任务,但它们缺乏基于重要性的特征排序机制。 Pham et al.(2022 (https://arxiv.org/html/2607.05653#bib.bib9)) 最近的工作通过他们的 PCA-自动编码器框架直接解决了潜在组分独立性和重要性排序问题。他们的方法引入了两个创新: 1. 1. 协方差最小化:一个惩罚潜在空间协方差矩阵非对角元素的损失项,以强制统计独立性。 2. 2. 顺序潜在扩展:训练一系列自动编码器,每次迭代添加新的潜在维度,同时冻结先前学习的组分。 虽然这种方法在 CelebA 和合成椭圆图像等数据集上成功分离了潜在特征,但存在关键局限性。顺序训练协议需要精心安排训练阶段,并且可能对过渡时机敏感,可能限制全局优化。由于每个阶段依赖于前一个阶段,该方法在传统意义上并非完全端到端可微,如果阶段边界未精确调整,可能会引入效率低下或过拟合。更根本的是,冻结组分保留最大方差贡献的隐含假设在实践中不成立,因为后续训练阶段通常会将解释能力重新分配给新添加的维度。 Perozo et al.(2024 (https://arxiv.org/html/2607.05653#bib.bib11)) 最近引入的 POLCA Net 代表了神经网络实现 PCA 类降维的重大进展。该架构利用多目标损失函数,包括正交性损失和方差正则化项。与 Pham 和 Ladjal 的工作类似,正交性损失项惩罚潜在空间协方差矩阵的非对角元素,以在保持非线性的同时强制独立性。然而,潜在空间组分的排序是通过统计估计和间接方差最大化实现的。在这方面,POLCA Net 与其他基于方差的正则化方法具有一个基本特征,例如有序方差自动编码器 (AEO) (Augustine et al.(2024 (https://arxiv.org/html/2607.05653#bib.bib27))),它通过一个显式强制潜在维度上方差单调递减的方差正则化项修改了重建损失。 从模型正则化的角度来看,ODIN 的树突结构可被视为一种隐式结构先验 (另见 Chen and Fuge (2024 (https://arxiv.org/html/2607.05653#bib.bib28)),而其正交性惩罚作为对潜在几何的显式约束。我们在下一节中论证,这种耦合使得在非线性设置中产生的潜在表示比基于方差的方法产生的表示更具泛化性和可解释性。 另一种约束神经网络权重的方法涉及黎曼梯度下降,它利用矩阵流形上的黎曼几何和优化技术来推广标准梯度下降方法 (Harandi and Fernando (2016 (https://arxiv.org/html/2607.05653#bib.bib22)); Fei et al.(2025 (https://arxiv.org/html/2607.05653#bib.bib26)))。该框架通过在约束流形上直接进行优化,而不是在无约束的欧几里得空间中,使得能够内在强制理想的结构属性,如正交性、正定性或固定秩约束。例如,Harandi and Fernando (2016 (https://arxiv.org/html/2607.05653#bib.bib22)) 通过使用 QR 分解等回缩算子在每个梯度步骤后维持约束,在 Stiefel 流形(具有正交列的矩阵集合)上优化来强制神经网络权重矩阵的正交性。虽然这种黎曼优化方法可以在训练期间严格强制正交性,并且已在凸和非凸设置中证明了收敛保证,但为了与更标准的基于反向传播的自动编码器进行比较,我们在此选择更简单的损失函数惩罚来强制正交性。 实现 PCA 类操作的另一种思想流派涉及赫布学习,这是一种生物上合理的网络策略,只需要突触前和突触后活动相关性。基本更新规则遵循 Δw ∝ y⟨x_i⟩,其中突触权重增加与突触前 (x_i) 和突触后 (y) 活动之间的相关性成正比 (Olshausen (1998 (https://arxiv.org/html/2607.05653#bib.bib21)))。Sanger 规则等扩展通过层次缺陷过程将这一框架推广到提取多个主成分,顺序学习按特征值大小排序的组分。与那些将正交性作为显式约束(例如,余弦相似度或黎曼优化中的 Stiefel 层)的自动编码器方法相比,赫布方法通过基于局部相关性的规则进行学习,具有指数收敛性。然而,赫布网络始终被标准的反向传播训练对应物所超越,并且仍然不足以满足现代深度学习管道的需求 (Amato et al.(2019 (https://arxiv.org/html/2607.05653#bib.bib25)); Miconi (2021 (https://arxiv.org/html/2607.05653#bib.bib24)); Kierkegaard and Morfeldt Gadler (2023 (https://arxiv.org/html/2607.05653#bib.bib23)))。 ### 变分自动编码器 变分自动编码器(VAE)被广泛认为是通用的生成模型,并且可被视为 ODIN 的自然比较点,主要是因为它们能够将高维数据映射到结构化的潜在空间中。VAE 通过将来自简单先验分布(通常是多元高斯分布)的潜在变量通过学习的生成网络转换为类似数据的样本来操作。在训练期间,编码器近似潜在变量的后验分布,而解码器则学习从这些潜在表示重建输入数据。这些概率约束通常会导致所谓的“解缠”表示,其中单个潜在变量对单个生成因子的变化敏感,而对其他因子的变化相对不变 (Bengio et al.(2013 (https://arxiv.org/html/2607.05653#bib.bib19)))。特别是,最近的研究结果,例如 Ichikawa and Hukushima (2024 (https://arxiv.org/html/2607.05653#bib.bib20)),表明 VAE 从学习纠缠表示开始,并在训练过程中逐渐获得解缠的潜在因子。此外,Ghojogh et al.(2021 (https://arxiv.org/html/2607.05653#bib.bib7)) 的当代工作揭示了 PCA、因子分析和变分自动编码器之间的理论联系。另见 Rolinek et al.(2019 (https://arxiv.org/html/2607.05653#bib.bib8)),他们证明了 VAE 中的对角后验近似会诱导类似于非线性 PCA 的局部正交模式。 VAE 将数据生成过程建模为 p(x) = ∫ p(x|z) p(z) dz,其中潜在变量 z 来自先验分布 p(z),通常为 N(0, I)。在训练期间,精确推断后验 p(z|x) 是难以处理的,需要通过变分分布 q(z|x) 进行近似。编码器网络通过输出分布参数(具体地,对于高斯情况为 μ(x) 和 σ²(x))来参数化这个近似后验,使得 q(z|x) = N(z | μ(x), σ²(x))。为了在保持随机性的同时实现基于梯度的优化,重参数化技巧将潜在代码表示为 z = μ(x) + σ(x) ⊙ ε,其中 ε ∼ N(0, I) 代表独立于网络的随机性。
相似文章
幻觉作为正交噪声:通过动态上下文正交化实现推理时流形对齐
本文提出动态上下文正交化(DCO),一种推理时方法,通过将注意力头输出与上下文流形对齐来减少大型语言模型中的幻觉,在Llama-3模型的基准测试中实现了更优的忠实度。
修正影响:利用正交潜在空间解构LLM输出
本文介绍了一个框架,通过稀疏自编码器学习正交潜在空间,实现对大型语言模型中词元级影响的归因,从而精确识别共同影响预测的训练数据词元,适用于医疗等高风险领域。
基于混合潜空间建模的结构连接组获取变异无监督学习
本文提出了一种无监督框架,通过混合潜空间建模来模拟结构连接组中与获取相关的变异,利用架构退火编码器输出消除了手动容量调优的需求。
Aitchison单纯形的树结构正交归一分解
本文介绍了PolyILR,一种与任意树拓扑对齐的Aitchison切空间的正交归一分解,为诸如微生物组和单细胞谱等成分数据提供了稳定且可解释的特征。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。