能量守恒神经管道:通过物理守恒约束减弱模块化神经网络中的错误传播

arXiv cs.LG 论文

摘要

引入能量守恒作为模块化神经网络中模块间信息流的硬物理约束,强制在模块边界精确保持激活能量,以减弱错误传播。在CIFAR-10和机器人管道上的实验显示出噪声鲁棒性的显著提升。

arXiv:2606.11341v1 公告类型:新 摘要:模块化神经网络管道存在错误累积问题:任何模块边界的噪声都会传播并在后续模块中可能放大。我们引入能量守恒作为模块间信息流的硬物理约束。强制在每一个模块边界精确保持激活能量(特征向量的平方L2范数)。与软能量惩罚不同,守恒是一条不可违背的法则:网络可以在神经元之间重新分配能量,但不能创造或消灭能量。在CIFAR-10上的四个实验表明:(1)在噪声sigma=0.2时,守恒保留了77.4%的干净准确率,而基线为35.1%,能量惩罚模型为30.9%(p<0.001,5个种子);(2)管道变得深度不变,在深度2至5且每个边界都有噪声时保留了93.3%;(3)该优势推广到系统偏差(+45.1%)、高斯噪声(+40.4%)和对抗噪声(+4.8%),对dropout有原则上的无影响(-0.3%);(4)在ResNet-18上,守恒优势与内在归一化呈反比:在sigma=0.2时,有BatchNorm时+0.3个百分点,无BatchNorm时+26.2个百分点,在sigma=0.5时达到+58.0个百分点。实验5在一个真实的模块化机器人管道(MuJoCo物理引擎,Franka Panda)上验证了该操作。在三个独立机器上的三次独立运行(每次90次试验)中,守恒在单目深度类噪声上提供了平均+18.9个百分点的优势。一个形式化界限证明,守恒后的噪声能量严格小于输入噪声能量。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:46

# 1. 引言
来源: https://arxiv.org/html/2606.11341
能量守恒神经管道

通过物理守恒约束缓解模块化神经网络中的误差传播

David Young†\\daggerSwan Yi Htet†\\dagger

ORION Robotics

†\\dagger同等贡献

工作技术报告

> **摘要**. 模块化神经网络管道饱受误差累积问题的困扰:任何模块边界的噪声都会传播,并可能被后续模块放大。我们引入**能量守恒**作为模块间信息流的一种硬物理约束。强制在每一个模块边界精确保持激活能量(特征向量的平方L2L^\{2\}范数)。与软能量惩罚不同,守恒是一条不可违背的法则:网络可以在神经元间重新分配能量,但无法创造或毁灭能量。在CIFAR-10上的四个实验表明:(1) 在噪声σ=0.2\\sigma=0.2下,守恒保留了77.4%±1.0%77.4\\%\\pm 1.0\\%的干净准确率,而基线为35.1%±1.1%35.1\\%\\pm 1.1\\%,能量惩罚模型为30.9%±0.9%30.9\\%\\pm 0.9\\%(p<0.001p<0.001,5个随机种子);(2) 管道变得深度无关,在深度2至5且每个边界都有噪声的情况下,仍保留93.3%的准确率;(3) 该优势可泛化到系统性偏差(+45.1%+45.1\\%)、高斯噪声(+40.4%+40.4\\%)和对抗噪声(+4.8%+4.8\\%),而对dropout则原则性地无效果(−0.3%-0.3\\%);(4) 在CIFAR-ResNet-18上,守恒优势与网络内在归一化的缺失相关联:使用BatchNorm时,在σ=0.2\\sigma=0.2下的差距为+0.3+0.3个百分点;不使用BatchNorm时,差距扩大至+26.2+26.2个百分点,并在σ=0.5\\sigma=0.5时达到+58.0+58.0个百分点。这明确了守恒作为模块边界处架构内归一化的替代方案。实验5在真实的模块化机器人管道(感知模块+电机控制模块,MuJoCo物理引擎,Franka Panda机械臂)上验证了该算子。在三台独立机器上进行的三个独立运行中(每个实验单元90次试验),守恒在单目深度类噪声上提供了+18.9+18.9个百分点的平均优势,这是真实感知到控制部署中占主导的失效模式。该算子在3D各向同性高斯噪声上作用中性,证实优势具有噪声类型特异性。一个形式化界限证明了守恒噪声能量严格小于输入噪声能量。关键词:能量守恒,模块化神经网络,误差传播,噪声抑制,物理约束

模块化神经网络架构将独立运行的子网络组合成多阶段管道。这种设计自然出现在机器人系统(感知→\\to规划→\\to控制)、多模态推理(视觉→\\to语言→\\to动作)和层次推理中。模块化使得组件能够独立开发、测试和改进。

然而,模块化引入了一个已被充分记录的失效模式:**误差累积**。当模块kk产生损坏的输出时,模块k+1k\{\+\}1处理这个损坏的输入。如果权重矩阵Wk+1\\mathbf\{W\}\_\{k+1\}的谱范数大于1(在训练好的网络中很常见),噪声就会被放大。经过KK个模块,噪声能量可能呈指数级增长:

E\(εK\)≤\(∏k=1Kσmax\(Wk\)2\)⋅E\(ε0\)\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\_\{K\}\)\\;\\leq\\;\\left\(\\prod\_\{k=1\}^\{K\}\\sigma\_\{\\max\}\(\\mathbf\{W\}\_\{k\}\)^\{2\}\\right\)\\cdot\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\_\{0\}\)(1)

其中σmax\(Wk\)\\sigma\_\{\\max\}\(\\mathbf\{W\}\_\{k\}\)是层kk的谱范数。这种指数级增长被认为是机器人学中经典的感知-规划-行动范式被端到端系统取代的主要原因\[1 (https://arxiv.org/html/2606.11341#bib.bib1),22 (https://arxiv.org/html/2606.11341#bib.bib22)\]\.

现有的解决此问题的方法大致分为两类:

- •**端到端学习**完全消除模块边界,训练单一的巨型模型。这避免了累积问题,但牺牲了模块化、可解释性以及改进单个组件的能力。
- •**正则化**在训练损失中添加惩罚项(dropout、噪声注入、能量惩罚),这些方法在统计上提高了鲁棒性,但不能提供确定性保证。

本文介绍了一种基于物理的第三种方法:**能量守恒**作为模块间信息流的硬约束。在每个模块边界,我们强制输出激活能量精确等于输入激活能量。这不是一个需要最小化的惩罚;它是一条在训练和推理期间都成立的守恒定律。

### 1.1 贡献

1. 1\.神经激活的能量守恒算子的形式化定义,并证明了守恒噪声能量严格有界于输入噪声能量(定理2.2 (https://arxiv.org/html/2606.11341#S2.Thmtheorem2))\.
2. 2\.实验证明,与无约束基线相比,守恒提高了+42.3%+42.3\\%的准确率保留,而表面相似的能量惩罚却使性能下降了−5.8%-5.8\\%\.
3. 3\.证据表明守恒使管道深度无关:即使在每个边界都有噪声的情况下,5模块管道与2模块管道的性能也相同。
4. 4\.发现了一个原则性的局限性:守恒能抑制能量**增加性**噪声,但不能抑制能量**移除性**噪声(dropout),这与理论框架一致。
5. 5\.在ResNet-18上进行的归一化消融研究定位了守恒机制。优势与架构内在归一化程度成反比,支持了守恒在模块边界处提供了BatchNorm在块内提供的正则化的解释。
6. 6\.在真实的模块化机器人管道(感知+电机控制,MuJoCo物理引擎,Franka Panda)上进行的验证,在三台独立机器上复现(每个实验单元90次试验),显示在深度漂移噪声上平均有+18.9+18.9个百分点的稳定优势。守恒在3D各向同性高斯噪声上作用中性,证实该优势是噪声类型特异性的,而非普遍性的。

## 2. 理论框架

### 2.1 激活能量

###### 定义2.1 (激活能量).

令x∈Rd\\mathbf\{x\}\\in\\mathbb\{R\}^\{d\}为神经网络层产生的激活向量。x\\mathbf\{x\}的能量定义为:

E\(x\):=‖x‖22=∑i=1dxi2\\mathcal\{E\}\(\\mathbf\{x\}\)\\;:=\\;\\left\\lVert\\mathbf\{x\}\\right\\rVert^\{2\}\_\{2\}\\;=\\;\\sum\_\{i=1\}^\{d\}x\_\{i\}^\{2\}(2)

这是物理学和信号处理中信号能量的标准定义。能量是非负的,并且对于不相关的信号是可加的:当⟨x,ε⟩=0\\langle\\mathbf\{x\},\\boldsymbol\{\\epsilon\}\\rangle=0时,

E\(x\+ε\)=E\(x\)\+E\(ε\)\\mathcal\{E\}\(\\mathbf\{x\}\+\\boldsymbol\{\\epsilon\}\)=\\mathcal\{E\}\(\\mathbf\{x\}\)\+\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)(3)

所有约束均按每个minibatch中的每个样本独立计算并强制执行,从而保留了标准的随机梯度下降动力学。

### 2.2 守恒算子

###### 定义2.2 (能量守恒算子).

令xin∈Rd1\\mathbf\{x\}\_\{\\textup\{in\}\}\\in\\mathbb\{R\}^\{d\_\{1\}\}为模块的输入,yraw=f\(xin\)∈Rd2\\mathbf\{y\}\_\{\\textup\{raw\}\}=f\(\\mathbf\{x\}\_\{\\textup\{in\}\}\)\\in\\mathbb\{R\}^\{d\_\{2\}\}为无约束输出。**守恒算子**定义为:

C\(xin,yraw\):=yraw⋅E\(xin\)E\(yraw\)\\mathcal\{C\}\(\\mathbf\{x\}\_\{\\textup\{in\}\},\\,\\mathbf\{y\}\_\{\\textup\{raw\}\}\)\\;:=\\;\\mathbf\{y\}\_\{\\textup\{raw\}\}\\cdot\\sqrt\{\\frac\{\\mathcal\{E\}\(\\mathbf\{x\}\_\{\\textup\{in\}\}\)\}\{\\mathcal\{E\}\(\\mathbf\{y\}\_\{\\textup\{raw\}\}\)\}\}(4)

其中E\(yraw\)\\mathcal\{E\}\(\\mathbf\{y\}\_\{\\textup\{raw\}\}\)被截断至max⁡\(E\(yraw\),10−8\)\\max\(\\mathcal\{E\}\(\\mathbf\{y\}\_\{\\textup\{raw\}\}\),\\,10^\{\-8\}\)以保证数值稳定性。

###### 命题2.1 (精确能量保持).

守恒算子精确保持能量:

E\(C\(xin,yraw\)\)=E\(xin\)\\mathcal\{E\}\\big\(\\mathcal\{C\}\(\\mathbf\{x\}\_\{\\textup\{in\}\},\\,\\mathbf\{y\}\_\{\\textup\{raw\}\}\)\\big\)\\;=\\;\\mathcal\{E\}\(\\mathbf\{x\}\_\{\\textup\{in\}\}\)

###### 证明.

令s=E\(xin\)/E\(yraw\)s=\\sqrt\{\\mathcal\{E\}\(\\mathbf\{x\}\_\{\\textup\{in\}\}\)/\\mathcal\{E\}\(\\mathbf\{y\}\_\{\\textup\{raw\}\}\)\}。则:

E\(s⋅yraw\)=s2⋅E\(yraw\)=E\(xin\)E\(yraw\)⋅E\(yraw\)=E\(xin\)∎\\mathcal\{E\}\(s\\cdot\\mathbf\{y\}\_\{\\textup\{raw\}\}\)=s^\{2\}\\cdot\\mathcal\{E\}\(\\mathbf\{y\}\_\{\\textup\{raw\}\}\)=\\frac\{\\mathcal\{E\}\(\\mathbf\{x\}\_\{\\textup\{in\}\}\)\}\{\\mathcal\{E\}\(\\mathbf\{y\}\_\{\\textup\{raw\}\}\)\}\\cdot\\mathcal\{E\}\(\\mathbf\{y\}\_\{\\textup\{raw\}\}\)=\\mathcal\{E\}\(\\mathbf\{x\}\_\{\\textup\{in\}\}\)\\qed

###### 定义2.3 (能量预算算子).

在管道入口点,我们建立一个固定的能量预算E0\>0E\_\{0\}\>0:

B\(x,E0\):=x⋅E0E\(x\)\\mathcal\{B\}\(\\mathbf\{x\},\\,E\_\{0\}\)\\;:=\\;\\mathbf\{x\}\\cdot\\sqrt\{\\frac\{E\_\{0\}\}\{\\mathcal\{E\}\(\\mathbf\{x\}\)\}\}(5)

这将任一特征向量归一化到精确的能量E0E\_\{0\},为管道建立初始能量供应。

### 2.3 几何解释

从几何角度看,守恒算子C\\mathcal\{C\}将yraw\\mathbf\{y\}\_\{\\textup\{raw\}\}投影到一个以原点为中心、半径为r=‖xin‖r=\\left\\lVert\\mathbf\{x\}\_\{\\textup\{in\}\}\\right\\rVert的超球面上。yraw\\mathbf\{y\}\_\{\\textup\{raw\}\}的方向(编码了学习到的变换)被保留;仅调整**幅度**。网络可以学习任何角度变换,包括任意旋转、反射或方向的非均匀缩放,唯一的约束是输出位于与输入同半径的球面上。

这与现有归一化方法在一个关键点上不同:

- •**L2L^\{2\}归一化**投影到单位球面(r=1r=1),破坏了所有幅度信息。两个幅度差异巨大的输入会产生范数相同的输出。
- •**BatchNorm**在批次维度上进行标准化,使其均值为零、方差为一,但不约束每个样本的能量。
- •**LayerNorm**独立地对每个样本进行标准化,将能量固定为一个与维度相关的常数,**与输入能量无关**。

关键的区分在于**因果性**:守恒将输出能量与输入能量联系起来,在管道中建立了方向性的能量流。一个自信的上游模块(高能量)将高能量传递给下游。一个不确定的模块(低能量)传递低能量。这种因果耦合在所有现有的归一化方法中都不存在。

### 2.4 噪声抑制界限

###### 定理2.2 (噪声抑制界限).

令x∈Rd\\mathbf\{x\}\\in\\mathbb\{R\}^\{d\}为一个干净的特征向量,能量为E0=E\(x\)E\_\{0\}=\\mathcal\{E\}\(\\mathbf\{x\}\),并令x~=x\+ε\\tilde\{\\mathbf\{x\}\}=\\mathbf\{x\}\+\\boldsymbol\{\\epsilon\},其中ε\\boldsymbol\{\\epsilon\}是与x\\mathbf\{x\}不相关的加性噪声(即⟨x,ε⟩=0\\langle\\mathbf\{x\},\\boldsymbol\{\\epsilon\}\\rangle=0)。在应用能量预算算子B\(x~,E0\)\\mathcal\{B\}\(\\tilde\{\\mathbf\{x\}\},E\_\{0\}\)之后,守恒输出中的噪声能量满足:

E\(εconserved\)=E0⋅E\(ε\)E0\+E\(ε\)<E\(ε\)\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\_\{\\textup\{conserved\}\}\)\\;=\\;\\frac\{E\_\{0\}\\cdot\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\}\{E\_\{0\}\+\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\}\\;<\\;\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)(6)

对于所有E\(ε\)\>0\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\>0,守恒噪声能量**严格小于**输入噪声能量。

###### 证明.

根据不相关噪声假设:

E\(x~\)=E\(x\)\+E\(ε\)=E0\+E\(ε\)\\mathcal\{E\}\(\\tilde\{\\mathbf\{x\}\}\)=\\mathcal\{E\}\(\\mathbf\{x\}\)\+\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)=E\_\{0\}\+\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)
守恒缩放因子为:

s=E0E0\+E\(ε\)s=\\sqrt\{\\frac\{E\_\{0\}\}\{E\_\{0\}\+\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\}\}
守恒输出是B\(x~,E0\)=s⋅\(x\+ε\)\\mathcal\{B\}\(\\tilde\{\\mathbf\{x\}\},E\_\{0\}\)=s\\cdot\(\\mathbf\{x\}\+\\boldsymbol\{\\epsilon\}\)。缩放后的噪声分量为s⋅εs\\cdot\\boldsymbol\{\\epsilon\},其能量为:

E\(s⋅ε\)\\displaystyle\\mathcal\{E\}\(s\\cdot\\boldsymbol\{\\epsilon\}\)=s2⋅E\(ε\)\\displaystyle=s^\{2\}\\cdot\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)=E0E0\+E\(ε\)⋅E\(ε\)\\displaystyle=\\frac\{E\_\{0\}\}\{E\_\{0\}\+\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\}\\cdot\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)=E0⋅E\(ε\)E0\+E\(ε\)\\displaystyle=\\frac\{E\_\{0\}\\cdot\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\}\{E\_\{0\}\+\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\}\(7\)
由于对于任意E\(ε\)\>0\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\>0,有E0\+E\(ε\)\>E0E\_\{0\}\+\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\>E\_\{0\},因此分数E0/\(E0\+E\(ε\)\)<1E\_\{0\}/\(E\_\{0\}\+\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\)<1,故E\(s⋅ε\)<E\(ε\)\\mathcal\{E\}\(s\\cdot\\boldsymbol\{\\epsilon\}\)<\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)。 ∎

###### 推论2.3 (渐近抑制).

当噪声能量无界增长时:

limE\(ε\)→∞E\(εconserved\)=E0\\lim\_\{\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)\\to\\infty\}\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\_\{\\textup\{conserved\}\}\)=E\_\{0\}

无论噪声变得多大,守恒后的噪声能量永远不会超过能量预算E0E\_\{0\}。这为噪声传播建立了一个硬上限,而这种上限在无约束的管道中是不存在的,在无约束管道中,噪声能量可以无界地增长为σmax\(W\)2⋅E\(ε\)\\sigma\_\{\\max\}\(\\mathbf\{W\}\)^\{2\}\\cdot\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)。

### 2.5 守恒与惩罚为何产生相反效果

令S=E\(x\)S=\\mathcal\{E\}\(\\mathbf\{x\}\)表示信号能量,N=E\(ε\)N=\\mathcal\{E\}\(\\boldsymbol\{\\epsilon\}\)表示噪声能量(在测试时固定)。信噪比为SNR=S/N\\text\{SNR\}=S/N。

**能量惩罚**将λ∑kE\(xk\)\\lambda\\sum\_\{k\}\\mathcal\{E\}\(\\mathbf\{x\}\_\{k\}\)添加到训练损失中。这导致训练过程中S→0S\\to 0。测试时,噪声具有固定幅度NN,因此SNR=S/N→0\\text\{SNR\}=S/N\\to 0。特征对噪声变得更**脆弱**,而不是更不脆弱。

**能量守恒**在训练期间保持S=E0S=E\_\{0\}。网络学会将信号能量集中在信息量大的维度上。测试时,噪声增加能量,但守恒将其重新缩放回E0E\_\{0\}。学习到的权重结构在重新缩放过程中优先保留信号丰富的维度,从而维持或改善了有效SNR。

这种理论上的区别精确预测了实验结果:惩罚降低了鲁棒性(−5.8%-5.8\\%),而守恒提高了鲁棒性(+42.3%+42.3\\%)。

### 2.6 学习到的能量重新分配

守恒算子对所有神经元应用一个**均匀的**缩放因子。然而,网络学习到的权重矩阵W\\mathbf\{W\}在守恒作用之前应用了一个**非均匀的**变换。在守恒约束下训练时,优化景观倾向于以下权重:

1. 1\.为与任务相关特征相关的神经元分配大的输出幅度。
2. 2\.为携带噪声或不相关信息的神经元分配小的输出幅度。

在线性变换和守恒重新缩放之后,高幅度神经元按比例保留更多的能量预算。这创造了一种**隐式的信号分离**:网络发展出一种能量分配策略,在守恒步骤中优先保留信息量丰富的维度。这里没有显式的去噪目标。

相似文章

面向广义PINNs的无模块化冲突规避训练

arXiv cs.AI

本文识别了物理信息神经网络(PINNs)中一种由容量引起的失效模式,其中过参数化网络发展出功能模块化,阻碍收敛,并提出模块稀疏同步(ModSync)框架,该框架惩罚任务专用连接以保持跨目标交互,并达到最先进的精度。

Dale约束下深度网络中的学习

arXiv cs.AI

本文介绍了一种受生物学启发的神经架构,该架构遵循Dale约束——神经元和突触具有固定符号——同时仍支持使用非负误差信号和局部Hebbian更新的类反向传播学习,并在Tiny ImageNet上取得了性能提升。