权重反馈在现代深度网络中局部计算Jacobian转置

arXiv cs.LG 论文

摘要

本文证明现代深度网络中预测编码(PC)使用的Jacobian转置乘积可以分解为局部可用的项,从而消除了自动求导反向传播的需要。提出的WF-Act-PC方法在CIFAR-10/100和Tiny-ImageNet上匹配甚至超越经过调优的反向传播基线,且性能随深度增加而提升。

arXiv:2607.13380v1 公告类型:新\n摘要:预测编码(PC)通过局部权重更新提供了一种受生物学启发的反向传播替代方案,然而层间误差路由仍然依赖于自动求导的Jacobian转置($J^\\top$)乘积——这是PC中最后一个非局部操作。我们证明这种依赖在很大程度上是可以避免的。对于任何具有冻结归一化统计量的层 $f(x)=\\mathrm{Act}(\\mathrm{Norm}(L(x)))$,精确的 $J^\\top$ 可以分解为三个局部可用的项:$J^\\top v = L^\\top(s \\odot \\sigma'(z) \\odot v)$,其中 $\\sigma'$ 是激活函数导数,$z$ 是预激活值,$s=\\gamma/\\sigma_{\\mathrm{run}}$ 是归一化增益。先前的权重反馈方法忽略了这两个修正;恢复它们可以弥合该层类的传输间隙。这里的局部性基于三个假设,我们提前说明:权重对称性($L^\\top$ 镜像前向算子,所有PC方法均假设)、非突触局部的软谱范数控制,以及MaxPool的最近邻近似。将恒等代入PC得到WF-Act-PC,它消除了误差传输中的自动求导反向传播。在CIFAR-10/100(50轮,5个随机种子)上,WF-Act-PC是唯一一种精度随深度提升的PC方法,在CIFAR-10上超越最强经典PC基线iPC达2.7-22.3个百分点。两种方法均按架构调优后,WF-Act-PC在更深的CIFAR-10架构(VGG-9: 93.57% 对 92.43%;ResNet-18: 92.76% 对 91.54%)以及更难的Tiny-ImageNet基准上匹配或超越经过类似调优的反向传播基线,而在更深的CIFAR-100 VGG单元上落后于调优后的BP。我们的WF-Act-PC实现公开发布于 https://github.com/jlshen025/pcax
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:21

# 权重反馈在现代深度网络中局部计算雅可比转置
来源:https://arxiv.org/html/2607.13380
沈俊龙1,2 李星宇1,2 1阿尔伯塔大学电气与计算机工程系,加拿大埃德蒙顿 2阿尔伯塔机器智能研究所(Amii),加拿大埃德蒙顿 junlong6@ualberta\.ca, xingyu@ualberta\.ca

###### 摘要

预测编码(PC)通过局部权重更新提供了反向传播的生物学启发替代方案,但层间误差路由仍依赖于自动求导的雅可比转置(J⊤J^\{\\\!\\top\})乘积——这是PC中最后的非局部操作。我们证明这种依赖在很大程度上是可以避免的。对于任何形式为f\(x\)=Act\(Norm\(L\(x\)\)\)f\(x\){=}\mathrm{Act}\(\mathrm{Norm}\(L\(x\)\)\)且归一化统计量冻结的层,精确的J⊤J^\{\\\!\\top\}可以*分解*为三个局部可用的项:J⊤v=L⊤\(s⊙σ′\(pre\-act\)⊙v\)J^\{\\\!\\top\}v=L^\{\\\!\\top\}\(\mathbf{s}\odot\sigma^{\prime}\(\mathrm{pre\text{-}act}\)\odot v\),其中σ′\sigma^{\prime}是激活函数的导数,s=γ/σrun\mathbf{s}{=}\gamma/\sigma_{\mathrm{run}}是每通道归一化增益。先前的权重反馈方法忽略了这两项修正;恢复它们为此类层弥补了传输差距。请注意,这里的局部性*基于*三个前提假设,我们在此明确说明——权重对称性(L⊤L^\{\\\!\\top\}与前向算子镜像,这是所有PC都假设的)、一种软频谱范数控制(非突触局部),以及MaxPool的最近邻近似。将该恒等式代入PC得到WF-Act-PC,它从误差传输中移除了自动求导反向传播。在CIFAR-10/100上(50个周期,5个随机种子),WF-Act-PC是唯一精度随深度*提升*的PC方法,在CIFAR-10上超越最强经典PC基线iPC达2.7–22.3个百分点。在两种方法均按架构调优的情况下,它在更深的CIFAR-10架构上匹配或超越了可比调优的反向传播基线(VGG-9:93.57% vs. 92.43%;ResNet-18:92.76% vs. 91.54%),并在难度更大的Tiny-ImageNet基准上表现更优,而在更深的CIFAR-100 VGG单元上落后于调优的BP。我们的WF-Act-PC实现公开发布于https://github.com/jlshen025/pcax。

关键词:信用分配⋅\\cdot生物合理学习⋅\\cdot预测编码⋅\\cdot反馈对齐⋅\\cdot雅可比转置⋅\\cdot权重对称性

††footnotetext:预印本。已被ECCV 2026接收;最终版本将出现在会议论文集中。## 1 引言

反向传播[21 (https://arxiv.org/html/2607.13380#bib.bib21)]通过每层雅可比转置J⊤J^\{\\\!\\top\}传播误差信号来计算权重梯度。该过程的两个特性缺乏已知的神经相关物[5 (https://arxiv.org/html/2607.13380#bib.bib5)]:反馈突触权重必须精确镜像前馈权重(*权重对称性*),并且误差信号必须在任何权重更新之前全局传播(*更新锁定*)。预测编码(PC)[20 (https://arxiv.org/html/2607.13380#bib.bib20),6 (https://arxiv.org/html/2607.13380#bib.bib6)]通过每层局部权重更新解决了更新锁定问题[25 (https://arxiv.org/html/2607.13380#bib.bib25),22 (https://arxiv.org/html/2607.13380#bib.bib22)],使其成为最有前景的生物合理学习框架之一。然而,在误差传输期间计算J⊤J^\{\\\!\\top\}——即在层间路由信用的操作——仍然需要自动求导向量-雅可比乘积(VJPs)[16 (https://arxiv.org/html/2607.13380#bib.bib16)]:这是PC中最后的非局部操作。反馈对齐(FA)[15 (https://arxiv.org/html/2607.13380#bib.bib15)]采取相反的方法,用固定随机矩阵BB替代J⊤J^\{\\\!\\top\},但在深卷积网络上失败[3 (https://arxiv.org/html/2607.13380#bib.bib3),13 (https://arxiv.org/html/2607.13380#bib.bib13)]。因此,在没有全局反向传播的情况下计算精确误差信号——即J⊤J^\{\\\!\\top\}传输问题——一直被认为是权重反馈架构的固有局限性。

我们重新审视这一观点。对于任何形式为f\(x\)=Act\(Norm\(L\(x\)\)\)f\(x\)=\mathrm{Act}\(\mathrm{Norm}\(L\(x\)\)\)的层——现代深度网络的标准构建块——经过两个局部可计算的修正增强的权重反馈可以恢复*精确*的J⊤J^\{\\\!\\top\}(图1 (https://arxiv.org/html/2607.13380#S1.F1)):

J⊤⋅v=L⊤\(s⊙σ′\(pre\-act\)⊙v\),J^\{\\\!\\top\}\cdot v\;=\;L^\{\\\!\\top\}\\\!\bigl\(\,\mathbf{s}\odot\sigma^{\prime}\(\mathrm{pre\text{-}act}\)\odot v\,\bigr\),\(1\)其中L⊤L^\{\\\!\\top\}是线性算子的转置(对称突触),σ′\(pre\-act\)\sigma^{\prime}\(\mathrm{pre\text{-}act}\)是逐点激活函数导数(类似于STDP可塑性痕迹),s=γ/σrun\mathbf{s}=\gamma/\sigma_{\mathrm{run}}是每通道归一化增益(类似于稳态除性归一化[4 (https://arxiv.org/html/2607.13380#bib.bib4)])。结果很简单——链式法则的三次应用(观察1 (https://arxiv.org/html/2607.13380#Thmobservation1));重要的是各因子的*局部性*,而非推导过程。关键在于,冻结归一化——在内循环期间以评估模式运行归一化层,这对于推理循环稳定性是自然选择——将JNormJ_{\mathrm{Norm}}压缩为一个固定对角矩阵,从而将完整的J⊤J^\{\\\!\\top\}简化为纯粹的局部因子。

范围与假设。为明确起见,所提出的方法精确指明了此处“局部”的含义与限制。WF-Act-PC从局部因子计算J⊤J^\{\\\!\\top\}*基于*三个前提假设:(i)*权重对称性*——L⊤L^\{\\\!\\top\}被视为镜像前馈算子LL,这也是PC(和BP)已有的假设;(ii)应用于权重以实现稳定性的*软频谱范数控制*,它使用幂迭代,因此不是突触局部的(尽管它在慢学习时间尺度上运行,且禁用它仅损失0.850.85个百分点;第5.5节 (https://arxiv.org/html/2607.13380#S5.SS5));(iii)MaxPool的*最近邻近似*,其精确J⊤J^\{\\\!\\top\}需要缓存的argmax索引(该近似损失≈1.25{\approx}1.25个百分点;第5.5节 (https://arxiv.org/html/2607.13380#S5.SS5))。在此范围内,等式 (1) 对于网络的非池化、冻结归一化部分是精确的。

该恒等式被忽视有两个历史原因。经典FA[15 (https://arxiv.org/html/2607.13380#bib.bib15)]早于批归一化[10 (https://arxiv.org/html/2607.13380#bib.bib10)]:FA分析的是f=σ\(Wx\)f=\sigma\(Wx\),其中W⊤vW^\{\\\!\\top\}v确实只是近似——缺少σ′\sigma^{\prime}。当归一化成为标准后,FA社区转向学习反馈矩阵[1 (https://arxiv.org/html/2607.13380#bib.bib1),12 (https://arxiv.org/html/2607.13380#bib.bib12)]和目标传播[14 (https://arxiv.org/html/2607.13380#bib.bib14)],将传输差距视为固有的。与此同时,PC通常在内循环推理期间冻结批统计量(以评估模式运行批归一化),但这被视为工程上的权宜之计;其隐含意义——JNormJ_{\mathrm{Norm}}压缩为固定对角矩阵,使得剩余修正完全局部化——未被注意到。两个社区各执一词:FA知道W⊤W^\{\\\!\\top\}是近似的,但缺少冻结归一化;PC有冻结归一化,但从未检查其雅可比结构。

将等式 (1) 代入PC的误差传输步骤得到WF-Act-PC,它从误差传输中移除了全局反向传播——在上述权重对称性和软频谱范数控制的限制下是局部的——无需辅助反馈网络,也无需目标传播。在CIFAR-10上(交叉熵,50个周期,5个随机种子),WF-Act-PC在每个架构上超越iPC[22 (https://arxiv.org/html/2607.13380#bib.bib22)]——最强经典PC基线——达2.72.7–22.322.3个百分点,并且在两种方法均按架构调优的情况下,在深度架构上达到BP水平的精度(VGG-9:93.5793.57% vs. 92.4392.43%;ResNet-18:92.7692.76% vs. 91.5491.54%)。在CIFAR-100上,WF-Act-PC从65.6465.64%(VGG-5)扩展到71.0771.07%(ResNet-18),在ResNet-18上超越调优BP达+0.85+0.85个百分点,而iPC崩溃(56.07→29.4556.07\to 29.45%),DPC-CN退化(66.85→60.5966.85\to 60.59%);然而,在最深的CIFAR-100 VGG单元上,调优BP追平(VGG-7持平,VGG-9上BP领先0.840.84个百分点)。在Tiny-ImageNet上(200类),WF-Act-PC再次随深度提升(46.0→61.146.0\to 61.1%,VGG-5→\toResNet-18),并在两个深度上超越调优BP。

贡献。

1. 1. 理论贡献。我们观察到,在冻结归一化下,任何Act\(Norm\(L\(⋅\)\)\)\mathrm{Act}\(\mathrm{Norm}\(L\(\cdot\)\)\)层的精确雅可比转置分解为局部可用的项——σ′\sigma^{\prime}和s\mathbf{s}以及L⊤L^\{\\\!\\top\}(观察1 (https://arxiv.org/html/2607.13380#Thmobservation1))。这一*局部性*解决了构成现代深度网络基础的层类的J⊤J^\{\\\!\\top\}传输问题。
2. 2. 算法贡献。我们推导出WF-Act-PC,一种用于深卷积网络的PC算法,其中误差传输由局部因子计算——在权重对称性和一个软的、慢时间尺度的频谱范数控制下是局部的,内循环中无需自动求导VJP。
3. 3. 实证贡献。WF-Act-PC在CIFAR-10/100和Tiny-ImageNet上超越最强经典PC基线iPC达2.72.7–22.322.3个百分点,并且是唯一精度随深度提升的PC方法。在两种方法均按架构调优的情况下,它在深度架构上达到BP水平的精度(VGG-7/9, ResNet-18),缩小了PC与反向传播在深卷积网络上的精度差距。

参见说明图1:WF-Act-PC概览。每层fl=Act\(Norm\(L\(⋅\)\)\)f_{l}=\mathrm{Act}\(\mathrm{Norm}\(L\(\cdot\)\)\)维护三个局部因子:对称突触L⊤L^\{\\\!\\top\}、激活函数导数σ′\sigma^{\prime}(STDP痕迹)和归一化增益s=γ/σrun\mathbf{s}=\gamma/\sigma_{\mathrm{run}}(稳态增益)。误差传输使用J⊤v=L⊤\(s⊙σ′⊙v\)J^\{\\\!\\top\}v=L^\{\\\!\\top\}\(\mathbf{s}\odot\sigma^{\prime}\odot v\);无需自动求导反向传播。画叉的箭头表示被消除的全局J⊤J^\{\\\!\\top\}计算。
## 2 相关工作

##### 预测编码。

PC[20 (https://arxiv.org/html/2607.13380#bib.bib20),6 (https://arxiv.org/html/2607.13380#bib.bib6)]假设大脑最小化层次预测误差。Whittington和Bogacz[25 (https://arxiv.org/html/2607.13380#bib.bib25)]证明PC权重更新在收敛时近似反向传播梯度。增量PC(iPC)[22 (https://arxiv.org/html/2607.13380#bib.bib22)]通过同时更新权重和状态来改善收敛,是最强的经典PC变体。PCX基准[18 (https://arxiv.org/html/2607.13380#bib.bib18)]提供标准化评估:iPC在VGG-5/CIFAR-10上达到85.5185.51%,但在ResNet-18上退化至70.4470.44%——这是所有被测试PC方法共有的深度缩放失败。

##### PC中的深度可扩展性。

近期几项工作从不同角度解决深度缩放问题。Qi等人[19 (https://arxiv.org/html/2607.13380#bib.bib19)]诊断出*能量不平衡*——预测误差集中在输出附近——并提出指数衰减加权(DPC-CN),在VGG-5上达到89.4689.46%但在VGG-9上退化至86.5586.55%。Goemaere等人[7 (https://arxiv.org/html/2607.13380#bib.bib7)]识别出基于状态的PC中的指数信号衰减,并引入基于误差的PC(ePC),这是一种消除信号衰减并在深度架构上匹配反向传播的重新参数化。Innocenti等人[9 (https://arxiv.org/html/2607.13380#bib.bib9)]通过Depth-μ\\muP参数化(μ\\muPC)将PC扩展到100+层,但仅限*全连接*残差网络;作者指出CIFAR-10性能“由于使用了全连接(而非卷积)架构而远非SOTA”,且未报告卷积结果。所有三种方法都改善了深度鲁棒性,但*保留了自动求导J⊤J^\{\\\!\\top\}计算*——我们的观察所针对的非局部操作——且均未在标准卷积基准上展示出竞争性的精度。

##### 反馈对齐与权重传输问题。

FA[15 (https://arxiv.org/html/2607.13380#bib.bib15)]用固定随机矩阵BB替代J⊤J^\{\\\!\\top\};直接FA[17 (https://arxiv.org/html/2607.13380#bib.bib17)]将输出误差直接投影到每一层。两者在深CNN上均失败[3 (https://arxiv.org/html/2607.13380#bib.bib3),13 (https://arxiv.org/html/2607.13380#bib.bib13)]。观察1 (https://arxiv.org/html/2607.13380#Thmobservation1)提供了一个更清晰的诊断:对于Act\(Norm\(L\(⋅\)\)\)\mathrm{Act}\(\mathrm{Norm}\(L\(\cdot\)\)\)层,L⊤vL^\{\\\!\\top\}v恰好缺少σ′\sigma^{\prime}和s\mathbf{s};恢复它们使得权重反馈是精确的(给定FA旨在避免的对称L⊤L^\{\\\!\\top\})。FA在此表现不佳并非因为权重反馈在根本上受限,而是因为缺少两个局部修正。

##### 其他生物合理方法。

目标传播[14 (https://arxiv.org/html/2607.13380#bib.bib14)]学习单独的逆映射;学习式FA[1 (https://arxiv.org/html/2607.13380#bib.bib1),12 (https://arxiv.org/html/2607.13380#bib.bib12)]训练反馈矩阵趋于W⊤W^\{\\\!\\top\}。两者都引入了辅助参数和训练复杂性。WF-Act-PC避免了这些:给定对称的W⊤W^\{\\\!\\top\},两个局部修正足以在此层类上实现精确传输。

## 3 预备知识

考虑一个前馈网络,具有映射\{fl\}l=1L\{f_{l}\}_{l=1}^{L}、参数\{Wl\}\{W_{l}\}、输入xx和目标yy。PC定义逐层预测误差εl=μl−fl\(μl−1\)\bm{\varepsilon}_{l}=\mu_{l}-f_{l}\(\mu_{l-1}\)以及变分自由能

E=12∑l=1L−1‖εl‖2\+L\(fL\(μL−1\),y\),E=\frac{1}{2}\sum_{l=1}^{L-1}\left\lVert\bm{\varepsilon}_{l}\right\rVert^{2}+\mathcal{L}\\!\bigl\(f_{L}\(\mu_{L-1}\),\,y\bigr\),\(2\)其中L\mathcal{L}是输出损失(所有实验中均为交叉熵)。训练交替进行*推理*——关于潜在状态\{μl}\{\mu_{l}\}(或等价地,误差\{εl}\{\bm{\varepsilon}_{l}\})最小化EE——和*学习*——在平衡状态更新权重\{Wl}\{W_{l}\}。

##### 误差传输与J⊤J^\{\\\!\\top\}问题。

在自上而下(高斯-赛德尔)更新方案[16 (https://arxiv.org/html/2607.13380#bib.bib16)]下,关于εl\bm{\varepsilon}_{l}的能量梯度形式为

∂E∂εl=εl−Jl\+1⊤⋅εl\+1,\frac{\partial E}{\partial\bm{\varepsilon}_{l}}=\bm{\varepsilon}_{l}-J_{l+1}^{\top}\cdot\bm{\varepsilon}_{l+1},\(3\)其中Jl\+1J_{l+1}是fl\+1f_{l+1}在当前状态评估的雅可比矩阵。权重更新是局部的——∂E/∂Wl\partial E/\partial W_{l}仅依赖于层ll和l−1l{-}1的活动。*唯一的非局部计算*是Jl\+1⊤⋅εl\+1J_{l+1}^{\top}\cdot\bm{\varepsilon}_{l+1}项:对于一个典型的Conv-BN-Act块,评估此乘积需要对整个块进行一次自动求导反向传播。

##### 基于误差的公式(来自ePC)。

遵循

相似文章

LeWorldModel:从像素出发的稳定端到端联合嵌入预测架构

Papers with Code Trending

LeWorldModel 提出了一种稳定的端到端联合嵌入预测架构(JEPA),可直接从像素进行训练,仅需极少超参数,并具有可证明的反坍塌保证。与基础模型相比,它在规划速度上实现了显著提升,同时在机器人操作任务中保持了具有竞争力的性能。