具有可学习通道-类别分配的仅前向卷积神经网络

arXiv cs.LG 论文

摘要

本文提出了一种用于仅前向卷积神经网络的可学习通道-类别分配机制,结合了熵和正交正则化以及损失感知的层级贡献策略。该方法在CIFAR-10、CIFAR-100和Tiny-ImageNet上实现了前向-前向算法中的最先进性能,显著缩小了与反向传播的差距。

arXiv:2606.09928v1 Announce Type: new 摘要:前向-前向(Forward-Forward, FF)算法通过用局部的、仅前向的目标替代基于梯度的信用分配,提供了一种受生物学启发的反向传播替代方案。虽然最近的扩展已将FF适配到卷积神经网络(CNN),但现有的公式依赖于静态的通道-类别分区,难以在复杂任务中有效执行。在这项工作中,我们引入了一种可学习的通道-类别分配机制,该机制支持卷积通道的自适应、数据驱动专业化,并辅以熵和正交正则化以提升学习性能。我们进一步提出了一种损失感知的层级贡献策略,该策略根据验证性能自适应地加权中间层预测,增强了仅前向推理的有效性。集成到残差CNN后,所提出的方法在CIFAR-10、CIFAR-100和Tiny-ImageNet上相比现有的类似仅前向方法持续实现更优性能。值得注意的是,它在基于FF的模型中建立了新的最先进性能,大幅缩小了与反向传播的差距。这些发现表明,引入可学习的通道专业化和层级贡献加权显著增强了深度CNN中仅前向学习的表示能力。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:18

# 带可学习通道-类别分配的前向-仅卷积神经网络
来源:https://arxiv.org/html/2606.09928

\[orcid=0009\-0001\-4465\-4503\]

\credit

概念化、方法论、调查研究、形式化分析、可视化、撰写——初稿。

\[orcid=0000\-0001\-6168\-4379\]

\credit

概念化、方法论、监督指导、撰写——审阅与编辑。

\[orcid=0000\-0002\-7016\-6853\]

\credit

验证、调查研究、撰写——审阅与编辑。

\[orcid=0000\-0002\-1701\-5562\]

\credit

监督指导、资金获取、项目管理、资源、撰写——审阅与编辑。

1] 机构=数学科学学院计算机与数据科学系,沙希德·贝赫什提大学,城市=德黑兰,国家=伊朗

2] 机构=沙希德·贝赫什提大学网络空间研究所,城市=德黑兰,国家=伊朗

3] 机构=赫特福德大学网络安全与计算系统研究组,城市=哈特菲尔德,国家=英国

\cortext

[1]通讯作者

Saeed Reza Kheradpishehs\_kheradpisheh@sbu\.ac\.irBahar Farahanib\_farahani@sbu\.ac\.irMahmood Fazlalim\.fazlali@herts\.ac\.uk[[[

###### 摘要

前向-前向(FF)算法通过用局部、仅前向的目标替代基于梯度的信用分配,提供了一种受生物启发的反向传播替代方案。虽然最近的扩展已将FF适配到卷积神经网络(CNN),但现有公式依赖于静态的通道-类别分区,并且在复杂任务中难以有效运行。在这项工作中,我们引入了一种可学习的通道-类别分配机制,该机制能够实现卷积通道的自适应、数据驱动特化,并通过熵和正交正则化来促进学习性能。我们进一步提出了一种损失感知的层贡献策略,该策略根据验证性能自适应地加权中间层预测,从而增强仅前向推理的有效性。集成到残差CNN后,所提方法在CIFAR-10、CIFAR-100和Tiny-ImageNet上相较于现有的类似仅前向方法取得了持续优越的性能。值得注意的是,它在基于FF的模型中建立了新的最先进性能,显著缩小了与反向传播的差距。这些发现表明,引入可学习的通道特化和层贡献加权显著增强了深度CNN中仅前向学习的表示能力。

###### 关键词:

前向-前向算法 \sep 卷积神经网络 \sep 仅前向学习 \sep 逐层学习

## 1 引言

深度学习在包括计算机视觉、自然语言处理及许多其他实际任务在内的不同领域取得了显著成功,这在很大程度上归功于通过反向传播进行的基于梯度的优化\[rumelhart1986learning,krizhevsky2012imagenet,vaswani2017attention\]。尽管取得了实证成就,但反向传播受到若干已充分记录的局限性约束。这些包括非常深网络中的梯度消失和爆炸\[bengio1994learning,glorot2010understanding\],对前向计算完整知识的依赖妨碍了神经网络内部的黑盒处理,在前向和反向传播期间存储激活所需的高内存需求,以及由于这些传播的顺序性导致的更新锁定\[huo2018decoupled\]。此外,反向传播在生物合理性方面面临若干众所周知的挑战\[lillicrap2016random\],例如依赖全局误差信号、前向与反向路径之间的对称权重传输假设、在计算梯度之前冻结中间活动状态的要求,以及推理与学习的分离。这些局限性促使探索一些替代方案,这些方案放宽了全局误差传输的严格要求,同时保留了强大的表示能力。

越来越多的研究关注于缓解与反向传播相关的一些挑战的方法。反馈对齐(FA)用随机固定矩阵替换精确反馈\[lillicrap2016random\],直接反馈对齐(DFA)将其扩展到逐层更新\[nokland2016direct\]。诸如权重镜像模型\[akrout2019weight\]等变体改进了反馈以提升学习。目标传播\[bengio2014auto,bartunov2018assessing\]及其基于差分的扩展\[lee2015difference,ernoult2022towards\]分配局部目标,而局部表示对齐\[reclra\]采用类似Hebbian的顶层向下信号。其他策略,包括解耦贪婪学习\[belilovsky2020decoupled\]、解耦神经接口\[jaderberg2017decoupled,czarnecki2017understanding\]和PEPITA\[pepita\],引入了辅助网络、合成梯度或扰动前向传递以实现局部更新。尽管这些方法放宽了严格反向传播的约束,但它们通常仍然依赖全局信号,并在可扩展性和准确性方面面临挑战。

最近提出的前向-前向(FF)算法引入了一种完全消除反向传播的范式\[hinton2022forward\]。原始的FF不是传播梯度,而是采用两次前向传递。第一次前向传递使用真实数据进行,第二次则使用损坏或负数据,目标是优化每一层的局部优良性度量。通过将训练重新构建为逐层对比过程,FF实现了受生物启发的信用分配,而无需显式的全局误差反向传播。然而,原始公式存在几个实际局限性,包括对优良性度量和损失函数选择的敏感性、多类分类中的低效,以及难以扩展到更深架构\[trifecta\]。

该算法的一个潜在局限性在于它运行在全连接架构上,这反过来又施加了许多限制\[ghaderflff,ghadersnn\]。因此,引入了若干种在卷积神经网络上实现FF的方法。最近,Sun等人\[deeperff\]提出了一种方法,旨在解决基于FF的架构中的网络加深问题,并在多个基准测试上使用基于FF的训练模型实现了最先进的准确率。本文提出了一种方法,以增强提出的基于FF的CNN方法,并克服其一些局限性。我们的主要贡献如下:

- •我们通过允许通道对分类过程的贡献自适应调整,而不是静态分配给特定类别,增强了卷积层的学习能力。
- •我们提出了一种新的方法,用于量化各个层对整体模型预测的贡献,该方法基于对其局部性能的评估。
- •所提出的方法表明,可学习的通道-类别分配比静态通道分组能够实现更高效的通道利用,从而以更少的通道获得更优的性能。

本文的其余部分组织如下:第2节(https://arxiv.org/html/2606.09928#S2)概述了相关工作和FF算法的背景。第3节(https://arxiv.org/html/2606.09928#S3)介绍了所提出的方法。第4节(https://arxiv.org/html/2606.09928#S4)详细说明了实验设置和结果。最后,第5节(https://arxiv.org/html/2606.09928#S5)对论文进行了总结,并提出了未来工作的方向。

## 2 相关工作与背景

本节概述了支撑我们方法的先前研究和理论基础。我们首先回顾前向-前向算法的基本原理及其关键进展,然后介绍近期将此框架扩展到卷积架构的努力。最后,我们概述了通道级卷积,并解释了其在仅前向训练方案下分类中的作用。

### 2.1 前向-前向算法

前向-前向算法被提出作为反向传播的一种简单且受生物启发的替代方案\[hinton2022forward\]。受玻尔兹曼机\[hinton1986boltzmann\]和噪声对比估计\[gutmann2010noise\]的启发,FF引入了一种贪婪学习方案,其中每一层最大化正数据的优良性(对应于正确或有意义的输入关联),并最小化负数据的优良性(由相同输入的损坏或错误关联形成)。这消除了反向传播,而是仅依赖局部目标。前向-前向算法的发展激发了一系列多样化的研究,这些研究可以围绕几个关键创新和概念方向进行组织。

一些研究致力于改进和缓解原始前向-前向算法的一些挑战。SymBa\[symba\]通过引入一种新的损失函数解决了原始FF算法的不对称性问题,该函数平衡了正负损失。与原始FF算法中正负样本梯度行为不同不同,SymBa的损失函数直接使用正负样本优良性的差异,使其对称。预测性前向-前向算法(Predictive Forward-Forward, PFF)\[PFF\]通过将预测编码的元素与前向-前向算法相结合,引入了一种神经系统的信用分配方法。它包含一个循环神经网络,具有用于获取数据表示的表示电路和用于合成数据的生成电路。FF算法的一个关键挑战是难以生成有说服力的负样本。在SCFF\[SCFF\]中,正样本通过拼接相同的数据样本来生成,而负样本则通过拼接来自不同类别的样本来构建。

注意力也致力于前向-前向算法的生物合理性和理论原理。Terres-Escudero等人\[neohebbian\]将FF与新Hebbian动力学联系起来,强化了其与局部突触可塑性理论的一致性,并为仅前向学习提供了生物学上合理的解释。Yang\[yang2023\]提供了FF激活中稀疏性的理论分析,表明涌现的表示类似于皮层编码模式。此外,一些研究\[ghadersnn,terressnn,ororbiasnn\]将FF扩展到事件驱动的脉冲神经系统中,证实了其与时间数据和神经形态计算兼容的潜力。

### 2.2 卷积前向-前向

最近的工作已将前向-前向算法扩展到全连接网络之外,通过将其适配到卷积架构,解决了与深度、特征提取和表示能力相关关键挑战。这些努力重新诠释了优良性的概念,引入了替代的局部目标,并修改了训练动态以更好地利用空间结构,同时保留了仅前向、逐层学习的原则。以下方法展示了卷积设计如何显著提升仅前向方法的性能。

Dooms等人\[trifecta\]引入了三种协同技术,以解决原始前向-前向框架在扩展到更深架构时的局限性。他们用对称对比SymBa损失替换了依赖阈值的损失,以提高稳定性;用批量归一化替代了基于长度的归一化,以保留层间信息并增强泛化;并提出了重叠局部更新,以在保持逐层独立性的同时提供半局部误差传播。总之,这些修改显著提高了前向-前向训练在深度可扩展性、准确性和稳定性方面的表现。

Zhao等人\[cafo\]提出了级联前向(Cascaded Forward, CaFo),这是一种受生物启发的反向传播替代方案,采用块状结构,带有局部附加预测器,这些预测器使用诸如均方误差、交叉熵或稀疏最大(sparsemax)等目标独立训练。CaFo不使用对称梯度传输,而是采用固定的随机反馈进行参数更新,与直接反馈机制的生物合理性相一致。推理时,所有预测器的预测被聚合形成最终决策,从而稳定分类并增强鲁棒性。通过消除对合成负样本和替代优良性度量的需求,CaFo减轻了计算负担,并引入了适用于并行训练的概率分类框架。

Papachristodoulou等人\[cwconv\]提出了CwComp,通过将通道划分为特定类别的子集并比较类内和类间激活,重新制定了卷积层中优良性的概念。他们引入了两种损失:PvN损失(扩展了原始前向-前向原则)和通道级竞争(Channel-wise Competition, CwC)损失(使用基于softmax的交叉熵进行逐层分类)。为了实施这一点,他们提出了通道级特征分离与提取器(CFSE)块,结合了标准卷积和分组卷积,以加强类内提取和类间分离。此外,他们设计了多种预测策略,并引入了交错层训练以加速收敛并减少停滞。

Sun等人\[deeperff\]指出了CwComp\[cwconv\]中的关键局限性,如神经元失活和优良性泄漏,这限制了其在浅层模型中的应用。为了解决这些问题,他们提出了DeeperForward,用平均优良性替代平方优良性,并采用层归一化以保持一致的特征统计。他们通过通道级卷积结构、残差捷径和信号整合模块扩展了框架,以选择性整合各层的预测。训练保持完全前向和局部,每层使用交叉熵损失独立优化。该方法支持跨GPU的模型并行,并包含一种通过释放中间状态来节省内存的策略,从而提高了深度架构的可扩展性和效率。

尽管CwComp\[cwconv\]和DeeperForward\[deeperff\]引入了显著的进步,但两种方法都依赖于预定义的静态通道分组机制,该机制在整个训练过程中将卷积通道永久性地划分为固定的、特定类别的子集。在CwComp中,分组卷积和通道级竞争学习明确地强制形成独立的类别依赖特征组,而DeeperForward\[deeperff\]通过通道级卷积(CW-Conv)结构保留了这一原则,该结构从固定的通道分区计算类别特定的优良性分数。尽管这些设计改善了类别分离并促进了逐层局部学习,但它们强加了一个限制性假设,即语义表示应永久与预定的通道子集对齐。这种刚性分配限制了网络动态调整通道特化以适应训练过程中不断变化的特征分布的能力,导致特征利用效率低下和表示灵活性降低。此外,固定的通道分配隐含地假设各类别具有相等的表示需求,并限制了跨组特征交互,可能阻碍共享语义结构的学习。

相似文章

利用LLM扩展闭环特征通道配置

arXiv cs.LG

本文将基于LLM的闭环通道配置搜索扩展到每周期250个候选,在CIFAR-100上展示了正向的准确率趋势和参数效率提升,并揭示了LLM生成的通道先验中的架构规律性。

输入凸神经网络训练的一种提升方法

arXiv cs.LG

提出了一种用于训练输入凸神经网络(ICNN)的“提升”方法,该方法使用无约束的超网络生成非负的层间权重,从而软化损失景观并避免梯度衰减,相比投影梯度下降和softplus重参数化,实现了更低的测试损失。