关于逻辑门网络的深度可扩展性

arXiv cs.LG 论文

摘要

本文指出了逻辑门网络无法从深度增加中受益的两个原因,并提出了输入锚定逻辑门网络(IALGNs),该方法使每一层都基于原始输入进行条件化,实现了超过100层的持续深度精度提升。

arXiv:2607.21633v1 公告类型:新 摘要:逻辑门网络(LGNs)通过布尔运算的组合实现计算,但与经典布尔电路不同,现有LGNs并未可靠地从深度增加中获益。我们识别出两个不同的原因:深度松弛LGNs中的优化崩溃,以及一种拓扑导致的限制——即使跳跃偏置初始化和直通估计稳定了训练,这种限制依然存在。因此,仅靠可训练性是不够的;更深层还必须接收支持有用计算的信息。 我们引入了输入锚定逻辑门网络(IALGNs),其中每个门将一个演化的隐藏特征与一个直接输入锚点组合。这种拓扑结构保留了一个计算主干,同时使每一层都基于原始输入进行条件化。我们证明了深度为D的路径最多可以依赖D+1个输入比特,并建立了一个严格的逐路径深度层次结构。随机k锚点松弛进一步改善了锚点选择,而不会松弛主干。 在MNIST、CIFAR-10和CIFAR-100上,IALGNs在超过100层的固定宽度上实现了持续的深度精度提升,而其他LGN拓扑则趋于饱和或退化。逐层探测、拓扑消融和有效深度分析表明,输入锚定产生了更具信息量的表示,并保留了更长的计算路径。这些结果表明,LGNs的可扩展深度既需要稳定的优化,也需要一种支持基于输入细化的信息访问模式。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:39

# 逻辑门网络的深度可扩展性研究
来源:https://arxiv.org/html/2607.21633

###### 摘要

逻辑门网络通过布尔运算的组合实现计算,但与经典布尔电路不同,现有的逻辑门网络无法可靠地从增加深度中获益。我们识别出两个不同的原因:深度松弛逻辑门网络中的优化崩溃,以及即使在使用偏向跳跃初始化与直通估计器稳定训练后仍持续存在的拓扑限制。因此,仅凭可训练性是不够的;更深层还必须接收到支持有用计算的信息。

我们引入了输入锚定逻辑门网络,其中每个门将一个演化的隐藏特征与一个直接的输入锚点相结合。这种拓扑结构保留了计算主干,同时使每一层都基于原始输入进行条件处理。我们证明,一条深度为\(D\)的路径可以依赖多达\(D+1\)个输入位,并建立了严格的逐路径深度层次结构。随机\(k\)锚点松弛进一步改善了锚点选择,而无需松弛主干。

在MNIST、CIFAR-10和CIFAR-100上,输入锚定逻辑门网络在超过100层的情况下实现了固定宽度下一致的深度-精度提升,而其他逻辑门网络拓扑结构则出现饱和或退化。逐层探针、拓扑消融实验和有效深度分析表明,输入锚定能够产生逐渐更具信息量的表示,并保留更长的计算路径。这些结果表明,逻辑门网络中的可扩展深度既需要稳定的优化,也需要一种支持输入条件化细化的信息访问模式。

参见图注

图1:两种架构的连接性概览。(a) 在随机布线逻辑门网络中,门的两个输入引脚均接收来自前一隐藏层的特征。(b) 在输入锚定逻辑门网络中,主干引脚接收来自前一隐藏层的特征,而锚点引脚直接接收来自原始输入的特征。因此,每个输入锚定逻辑门网络层在细化其隐藏表示的同时,始终保持对输入的条件处理。

## 1 引言

逻辑门网络是一种通过布尔运算组合实现计算的神经架构,与经典布尔电路非常相似。通过用逻辑门替换传统的实值神经元,逻辑门网络提供了一种结构化的、可解释的计算模型,与高效离散推理直接相关。

从布尔电路理论的角度来看,深度是一种基础的计算资源。增加电路深度可以严格扩大表示能力,并且当深度不足时,广泛的函数类需要指数级更大的电路(Hastad1986 (https://arxiv.org/html/2607.21633#bib.bib1))。这些结果表明,按深度扩展逻辑门网络在理论上是有意义的,在实践中也是有益的。

构建逻辑门网络需要确定每个门执行的逻辑运算以及连接各层门的布线。由于这个设计空间是离散且组合的,可微分逻辑门网络用可以通过梯度下降优化的连续松弛替代离散运算选择(Petersen et al. 2022 (https://arxiv.org/html/2607.21633#bib.bib4); Kim2023 (https://arxiv.org/html/2607.21633#bib.bib11))。然而,尽管在门优化方面取得了显著进展,现有逻辑门网络并未表现出可靠的深度-性能缩放。大多数报道的架构仍然相对较浅,增加深度常常导致精度饱和或下降。因此,电路理论预测的计算优势在实际逻辑门网络中尚未得到充分实现。

这种失败通常归因于优化困难。通过许多松弛布尔运算传播的梯度迅速消失,而松弛训练与离散推理之间的差异进一步破坏了学习的稳定性。最近的进展,包括随机松弛、直通估计器和偏向跳跃初始化,显著提高了可训练性并稳定了深层逻辑门网络的优化(Kim2023 (https://arxiv.org/html/2607.21633#bib.bib11); Petersen et al. 2024 (https://arxiv.org/html/2607.21633#bib.bib5); Yousefi et al. 2025 (https://arxiv.org/html/2607.21633#bib.bib6); Rüttgers et al. 2025 (https://arxiv.org/html/2607.21633#bib.bib7))。然而,即使优化保持稳定,随机布线逻辑门网络从增加深度中仍然获益甚微。

我们认为深度可扩展性需要满足两个不同的条件。首先,更深层必须接收到足够的学习信号(优化)。其次,网络拓扑必须使每个额外层能够执行有用的计算,而不是反复重组现有的隐藏表示(计算)。现有的优化技术主要解决了前者,但对后者未作改变。

为了解决这一限制,我们提出了输入锚定逻辑门网络。每个门将一个通过固定隐藏计算主干传播的特征与一个直接从原始输入采样的特征相结合。这一简单的修改使得每一层能够在不断引入新输入信息的同时细化累积的计算。我们进一步证明,由此产生的拓扑结构诱导了一个严格的逐路径深度层次结构,将架构提供的计算能力与优化提供的可训练性区分开来。

经验上,偏向跳跃初始化和直通估计器在随机布线逻辑门网络和输入锚定逻辑门网络中都稳定了优化,但只有输入锚定逻辑门网络表现出系统性的固定宽度深度缩放。在MNIST、CIFAR-10和CIFAR-100上,逐层探针显示表示逐渐改善,拓扑消融实验表明输入锚定至关重要,有效深度分析表明输入锚定逻辑门网络在网络中保留了更长的计算路径。

我们的贡献总结如下:

- • 我们区分了逻辑门网络深度可扩展性的两个障碍:优化崩溃和渐进表示细化中的拓扑限制。我们证明仅解决优化问题并不能使额外的深度变得有用。
- • 我们提出了输入锚定逻辑门网络,这是一种最小化的输入锚定拓扑结构,采用随机\(k\)锚点松弛,并建立了严格的逐路径深度层次结构,表明增加深度扩大了个体路径的计算能力。
- • 我们在MNIST、CIFAR-10和CIFAR-100上展示了一致的固定宽度深度缩放。线性探针、拓扑消融实验和有效计算深度分布将观察到的性能提升与逐渐更丰富的表示和更长的幸存计算路径联系起来,而非通用的布线灵活性。

## 2 相关工作

### 可微分逻辑门网络。

可微分逻辑门网络通过将16种二输入布尔函数的离散选择松弛为一个可微优化问题,实现了基于梯度的布尔电路学习(Petersen et al. 2022 (https://arxiv.org/html/2607.21633#bib.bib4))。最初的公式采用随机布线的前馈连接以及偏向跳跃初始化,为后续逻辑门网络研究奠定了基础。

最近的工作在几个大致正交的方向上改进了可微分逻辑门网络。卷积可微分逻辑门网络通过结构化的逻辑核将逻辑门计算扩展到空间视觉任务(Petersen et al. 2024 (https://arxiv.org/html/2607.21633#bib.bib5))。其他研究通过减少离散化差距或引入更有效的门参数化来改进优化,包括随机松弛、直通估计器和轻量级门表示(Kim2023 (https://arxiv.org/html/2607.21633#bib.bib11); Yousefi et al. 2025 (https://arxiv.org/html/2607.21633#bib.bib6); Rüttgers et al. 2025 (https://arxiv.org/html/2607.21633#bib.bib7))。最近,循环参数共享(Bührer et al. 2025 (https://arxiv.org/html/2607.21633#bib.bib8))、可微连接性优化(Mommen et al. 2026 (https://arxiv.org/html/2607.21633#bib.bib14))以及面向硬件的连接性学习(Fojcik et al. 2026 (https://arxiv.org/html/2607.21633#bib.bib15))进一步拓宽了可微分逻辑门网络的设计空间。然而,与我们的工作不同,这些方法主要修改门参数化、优化或连接性学习,而非跨层的信息访问模式。因此,它们没有明确研究层间拓扑本身是否限制了深度可扩展性。

### 深度网络中的拓扑与信息流。

在传统的深度神经网络中,架构连接性在使深度有效方面起着核心作用。残差连接和密集连接通过创建早期和晚期表示之间的短路径来改善信息传播,使深度网络能够逐步细化特征,而不是反复覆盖它们(Veit et al. 2016 (https://arxiv.org/html/2607.21633#bib.bib13); Bhardwaj et al. 2019 (https://arxiv.org/html/2607.21633#bib.bib12))。将这些原理应用于逻辑门网络并非易事,因为逻辑门在严格的二输入约束和饱和布尔语义下运行,使得标准的加法跳跃连接不适用。我们没有学习任意的隐藏连接,而是引入了一种最小拓扑,其中每个门保留一个隐藏层主干,同时保持对原始输入的直接访问。因此,我们的方法是对先前逻辑门网络研究的补充:我们不是改进单个门或其优化,而是研究修改信息访问模式本身是否能够实现可扩展深度。

参见图注

图2:仅靠优化稳定性不足以实现深度可扩展性。(a,b) 不同初始化和训练设置下的逐层更新幅度。偏向跳跃初始化和直通估计器显著改善了深层网络中的更新传播。(c) 尽管优化稳定,随机布线逻辑门网络未能从增加深度中获益,而输入锚定逻辑门网络则持续改进,表明优化本身并不能解释深度可扩展性。子图(c)中的输入锚定逻辑门网络曲线使用了Skip init + STE。

## 3 为什么深层可微分逻辑门网络无法扩展

优化崩溃是训练深层逻辑门网络的一个众所周知障碍。由于梯度必须通过许多松弛布尔运算传播,到达早期层的学习信号随着深度增加迅速减弱,常常阻止深层模型收敛。最近的研究通过偏向跳跃初始化和直通估计器显著缓解了这一问题,使得训练相当深的逻辑门网络成为可能(Petersen et al. 2022 (https://arxiv.org/html/2607.21633#bib.bib4); Kim2023 (https://arxiv.org/html/2607.21633#bib.bib11); Yousefi et al. 2025 (https://arxiv.org/html/2607.21633#bib.bib6); Rüttgers et al. 2025 (https://arxiv.org/html/2607.21633#bib.bib7))。这自然引出一个重要问题:如果优化已经可以稳定,为什么随机布线逻辑门网络仍然无法从增加深度中获益?

为了将优化与架构效应分开,我们比较了随机布线逻辑门网络和所提出的输入锚定逻辑门网络在四种代表性训练设置下的表现:随机初始化、偏向跳跃初始化、直通估计器及其组合。参照(Petersen et al. 2022 (https://arxiv.org/html/2607.21633#bib.bib4)),我们测量逐层参数更新幅度而非原始梯度,因为自适应优化器在应用参数更新之前会在内部重新缩放梯度。因此,更大的更新幅度表明该层更积极地参与了优化。

图2(a,b)显示,现代优化技术显著缓解了优化崩溃。偏向跳跃初始化大大改善了随机布线逻辑门网络中的优化,而直通估计器在输入锚定逻辑门网络中提供了特别强的稳定性。在最强的优化设置(Skip init + STE)下,两种架构中几乎所有层的参数更新都保持较大,表明优化崩溃在很大程度上得到了缓解。

然而,仅靠稳定的优化并不能使额外的深度变得有用。图2(c)在同一训练设置下考察了随着网络深度增加预测性能的变化。尽管网络中各层的参数更新健康,随机布线逻辑门网络从增加深度中获益甚微,并最终开始退化。相比之下,在相同的优化协议下,输入锚定逻辑门网络随着引入更多层而持续改进。

这些观察表明,深度可扩展性需要满足两个不同的条件。优化决定了深层网络能否成功训练,而网络拓扑决定了更深层是否执行额外的有用计算。因此,稳定的优化对于可扩展深度是必要的,但并非充分条件。本文的剩余部分研究修改每层可用信息如何使随着深度增加而逐渐更有用的计算成为可能。在下一节中,我们将展示为每个门提供对原始输入的直接访问从根本上改变了增加深度所启用的计算。

## 4 输入锚定逻辑门网络

参见图注

图3:输入锚定逻辑门网络与随机\(k\)锚点松弛。(a) 输入锚定逻辑门网络用双引脚结构替代了标准逻辑门网络中完全随机的层间布线。主干引脚接收来自前一层的对应隐藏特征,保留了层到层的计算路径。锚点引脚直接接收来自原始输入的特征,确保每一层都保持对输入的条件处理。(b) 随机\(k\)锚点松弛为每个门采样\(k\)个候选输入锚点,并学习松弛选择,提高了锚点灵活性,而无需搜索所有可能的输入连接。

### 设计原理

第3节的结果表明,剩余的局限性在于每层可用信息。在传统的随机布线逻辑门网络中,每个门仅接收前一层产生的隐藏特征。随着深度增加,后面的门反复对已经总结先前计算的特征进行布尔运算组合,主要增加了现有特征交互的复杂性。输入锚定逻辑门网络则保留了隐藏计算路径,同时持续将每一层暴露给原始输入。因此,每一层执行输入条件化细化,利用新可用的输入信息更新累积的计算。因此,增加深度扩展了网络执行的计算,而不仅仅是重组早期的表示。

可以认为所提出的架构是并行计算链的集合。然而,每条链执行的是深度相关的布尔组合,而非独立的浅层预测;共享的GroupSum读出机制聚合了最终的深层特征,而非一组独立的分类器。

参见图注

图4:输入锚定实现的渐进表示学习。(a) 冻结隐藏表示上的逐层线性探针精度。与随机布线可微分逻辑门网络不同,输入锚定逻辑门网络在CIFAR-10(实线)和CIFAR-100(虚线)上均表现出随着深度增加探针精度逐渐提高,表明更深层产生了更具信息量的表示。(b) 探针精度

相似文章

DLLG:LLM专家的动态Logit级门控机制

arXiv cs.CL

DLLG(动态Logit级门控)是一种新颖的框架,通过轻量级可学习门控模块,在token级别的logit空间中动态融合多个专门化LLM,在推理和代码基准测试中超越了路由、启发式集成和参数合并等基线方法。该方法仅需稀疏的响应级监督信号,且在无需重新训练的情况下保留了专家模块的独立性。