用于在线自监督Echo State Networks的可扩展扰动学习

arXiv cs.LG 论文

摘要

提出了一种基于扰动的学习规则,用于Echo State Networks中的在线自监督学习,通过分解学习成本并仅扰动输入相关部分,避免了依赖于储层大小的方差增长。

arXiv:2607.06079v1 公告类型: 新 摘要:智能系统不仅应能解决问题,还应在实际约束下适应。通过自监督学习的自主适应、通过在线学习的顺序适应以及通过基于扰动学习的内存高效实现是此类系统的重要要求。然而,这些要求在高维系统中通常相互冲突,因为基于扰动学习的方差会随着扰动变量的维度增长而增加。 在本研究中,我们关注Echo State Networks(ESNs),这种冲突自然出现在大型储层中。我们提出了一种基于扰动的学习规则,用于ESNs中的在线自监督学习。该规则源自自监督学习成本的正交分解,将输入相关部分与由固定ESN参数决定的冗余部分分离。通过仅扰动输入相关部分,有效扰动维度从储层维度降低到输入维度。 因此,所提出的方法保留了自监督适应、在线学习和标量反馈扰动学习,同时避免了依赖于储层大小的方差增长。这为可扩展且硬件兼容的学习提供了一个设计原则:在线学习应限制在目标动态必要的低维分量上。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:45

# 面向在线自监督回声状态网络的可扩展扰动学习
来源:https://arxiv.org/html/2607.06079
###### 摘要

智能系统不仅应能解决任务,还应在现实约束下进行自适应。通过自监督学习实现自主自适应、通过在线学习实现顺序自适应、以及通过基于扰动学习实现内存高效实现,是此类系统的重要要求。然而,对于高维系统而言,这些要求通常相互矛盾,因为基于扰动学习的方差会随着被扰动变量的维度增长而增大。

在本研究中,我们聚焦于回声状态网络(ESN),其中大型储层中自然会出现这种矛盾。我们提出了一种用于ESN在线自监督学习的基于扰动学习规则。该规则源自自监督学习代价的正交分解,该分解将输入依赖分量与由固定ESN参数决定的冗余分量分离。通过仅扰动输入依赖分量,有效扰动维度从储层维度降低至输入维度。

因此,所提出的方法保留了自监督自适应、在线学习和标量反馈扰动学习,同时避免了依赖储层规模的方差增长。这提出了一种可扩展且硬件兼容的学习设计原则:在线学习应仅限于目标中动态所需的低维分量。

\affiliation

\[utokyo\] organization=东京大学信息科学与技术研究生院, addressline=7-3-1 Hongo, city=Bunkyo-ku, postcode=113-8656, state=东京, country=日本

## 1 引言

构建能够持续适应复杂现实动态的智能系统是机器学习和神经形态工程中的一个重要目标\[16 (https://arxiv.org/html/2607.06079#bib.bib9),15 (https://arxiv.org/html/2607.06079#bib.bib10)\]。此类系统必须在有限的计算和内存资源下处理时间信息\[14 (https://arxiv.org/html/2607.06079#bib.bib4),6 (https://arxiv.org/html/2607.06079#bib.bib8)\]。储层计算遵循这一方向,它通过使用循环动态系统作为时间特征提取器,并减少模型的可训练部分\[13 (https://arxiv.org/html/2607.06079#bib.bib11),22 (https://arxiv.org/html/2607.06079#bib.bib5)\]。回声状态网络\[jaeger2001echo\]是储层计算的一个代表性模型,其中储层是一个固定的循环神经网络。

实现此类持续自适应系统需要满足三个条件。首先,学习应是在线且自监督的,以便系统能够在不可预测的环境中无需外部目标标签进行自适应\[16 (https://arxiv.org/html/2607.06079#bib.bib9)\]。其次,储层维度应是可扩展的,因为大型储层常用于表示高维动态和长时间依赖\[8 (https://arxiv.org/html/2607.06079#bib.bib12),2 (https://arxiv.org/html/2607.06079#bib.bib13)\]。第三,这种扩展不应依赖于大型辅助内存或复杂的错误路由\[6 (https://arxiv.org/html/2607.06079#bib.bib8),10 (https://arxiv.org/html/2607.06079#bib.bib15),11 (https://arxiv.org/html/2607.06079#bib.bib14)\]。这一要求对于利用储层动态而非依赖通用计算和完整内存访问的硬件实现尤为重要。

这些要求之间存在矛盾。为了解释这一点,我们将输入、储层和输出维度分别记为$n_{in}$、$n_{r}$和$n_{out}$。尽管回声状态网络可以通过有监督的读层学习应用于各种时间任务,但只有特定任务允许自监督的公式化表述。在本文中,我们考虑在先前的\[25 (https://arxiv.org/html/2607.06079#bib.bib6)\]中研究的任务,其中系统学习从储层动态中恢复外部输入,而无需外部教学信号。对于此任务,$n_{out}=n_{in}$。我们先前的工作将此问题重新表述为,不是训练一个通常的$n_{in} \times n_{r}$输出映射,而是训练一个$n_{r} \times n_{r}$的映射,该映射重构储层状态本身。由于自监督公式化的考虑,重构目标和重构误差都位于$n_{r}$维的储层空间中。

批量最小二乘法\[Legendre1805,Gauss1809\]不适用于此设置,因为它不是在线方法,并且需要存储数据并在数据收集后求解全局逆问题\[jaeger2001echo,[7 (https://arxiv.org/html/2607.06079#bib.bib16),13 (https://arxiv.org/html/2607.06079#bib.bib11)\]\]。递归最小二乘法\[18 (https://arxiv.org/html/2607.06079#bib.bib19)\]使更新实现在线,但它维护一个大小为$O(n_{r}^{2})$的精度矩阵,导致二次内存成本\[21 (https://arxiv.org/html/2607.06079#bib.bib17),13 (https://arxiv.org/html/2607.06079#bib.bib11)\]。随机梯度下降\[20 (https://arxiv.org/html/2607.06079#bib.bib20),1 (https://arxiv.org/html/2607.06079#bib.bib21)\]可以被视为避免这一二次状态的逐样本在线替代方法。然而,在自监督学习设置中,它仍然需要在每个时间步提供一个$n_{r}$维的错误信号。因此,即使内存成本降低了,学习仍需要$O(n_{r})$个错误缓冲区和反馈通道,以向重构单元提供不同的错误信号。

基于扰动学习\[9 (https://arxiv.org/html/2607.06079#bib.bib22)\]提供了一种避免此类逐单元错误反馈的可能方式,但其标量反馈引入了方差缩放问题\[23 (https://arxiv.org/html/2607.06079#bib.bib25),19 (https://arxiv.org/html/2607.06079#bib.bib28)\]。在权重扰动\[4 (https://arxiv.org/html/2607.06079#bib.bib23)\]和节点扰动\[3 (https://arxiv.org/html/2607.06079#bib.bib24)\]中,参数更新是根据随机扰动和目标函数的标量变化估计的。因此,$n_{r}$维的重构误差被压缩成一个单一的全局标量信号。这消除了多通道错误路由的需要,并用一个可以全局广播的标量反馈信号取而代之\[4 (https://arxiv.org/html/2607.06079#bib.bib23),3 (https://arxiv.org/html/2607.06079#bib.bib24)\]。然而,同样的压缩使得梯度估计的方差随网络规模增大而增加\[23 (https://arxiv.org/html/2607.06079#bib.bib25),19 (https://arxiv.org/html/2607.06079#bib.bib28)\]。在当前的$n_{r} \times n_{r}$学习问题中,权重扰动的方差缩放为$O(n_{r}^{2})$,节点扰动的方差缩放为$O(n_{r})$。因此,随着$n_{r}$的增加,估计的信噪比降低,使得基于扰动学习对高维储层效率低下。

在本文中,我们通过利用回声状态网络中在线自监督学习的数学结构来解决这一方差缩放问题。我们证明了自监督代价函数可以正交分解为两项。一项与在线输入序列无关,可以通过固定变换移除。另一项依赖于输入驱动的储层状态序列,必须从在线数据中学习。关键观察是,这一在线项与外部输入相关联,其维度为$n_{in}$,而非与完整储层状态相关联,其维度为$n_{r}$。因此,我们仅通过基于扰动学习在线学习输入依赖项。当使用所学映射时,我们应用固定变换来消除离线项。通过仅对输入依赖项应用基于扰动学习,我们将梯度估计的方差缩放从$O(n_{r})$降低至$O(n_{in})$。因此,所提出估计的信噪比不再随储层维度恶化。这一特性在实践中很有用,因为在大型回声状态网络中,$n_{in}$通常远小于$n_{r}$。所提出的学习规则保留了基于扰动学习提供的标量全局反馈优势,同时提高了在线自监督学习的可扩展性。这使得在线自监督学习与内存访问和反馈路由受限的大型储层和硬件设置更加兼容。

本文的其余部分组织如下。第2节介绍了回声状态网络中在线自监督学习的理论公式化。第2.1节回顾了一般的在线学习规则,即梯度下降、随机梯度下降、权重扰动和节点扰动。第2.2节回顾了先前工作中介绍的回声状态网络自监督公式化,本研究基于此。第2.3节介绍了我们的主要贡献,即正交代价分解以及由此产生的基于扰动学习规则。第3节通过数值实验验证了理论上预测的缩放行为,并将所提出的方法与权重扰动和节点扰动进行了比较。第4节讨论了其含义和局限性。第5节总结了本文。

## 2 理论公式化

在本节中,$\langle\cdot\rangle_{u}$ 表示关于随机变量$u$分布的期望。对于对称正定矩阵$G$和$H$,我们定义诱导范数
$$
\|x\|_{G}^{2} := x^{\top}Gx, \quad \|X\|_{G,H}^{2} := \mathrm{tr}\!\left(GXHX^{\top}\right),
$$
并记 $\|x\|:=\|x\|_{I}$ 和 $\|X\|:=\|X\|_{I,I}$ 为标准欧几里得范数和Frobenius范数。

### 2.1 学习算法

我们回顾在线学习规则的一般形式化。作为参考,梯度下降法\[Cauchy1847\]使用全批量梯度最小化损失;其在线版本包括随机梯度下降\[20 (https://arxiv.org/html/2607.06079#bib.bib20)\]、权重扰动\[4 (https://arxiv.org/html/2607.06079#bib.bib23)\]和节点扰动\[3 (https://arxiv.org/html/2607.06079#bib.bib24)\]。考虑一个具有待训练参数矩阵$W$和输入$z$的系统。设$\ell(W;z) \in \mathbb{R}$表示输入$z$的瞬时损失,并将期望目标函数定义为
$$
L(W) = \langle \ell(W;z) \rangle_{z}. \tag{1}
$$
我们考虑找到最小化期望目标函数$L(W)$的$W$的问题。

目标函数$L$的梯度下降算法(GD)\[Cauchy1847\]定义为
$$
\Delta^{\mathrm{GD}}W = -\eta \frac{\partial L(W)}{\partial W} = -\eta \left\langle \frac{\partial \ell(W;z)}{\partial W} \right\rangle_{z}, \tag{2}
$$
其中$\eta > 0$是学习率。

如果$z$的真实分布未知,则式(2 (https://arxiv.org/html/2607.06079#S2.E2))中的期望$\langle\cdot\rangle_{z}$无法直接计算。随机梯度下降(SGD)\[20 (https://arxiv.org/html/2607.06079#bib.bib20)\]通过用经验平均值代替期望来近似GD。特别地,对于给定的输入样本$z$,针对目标函数$L(W)=\langle\ell(W;z)\rangle_{z}$的SGD定义为
$$
\Delta^{\mathrm{SGD}}W = -\eta \frac{\partial \ell(W;z)}{\partial W}. \tag{3}
$$
SGD在平均意义上等价于GD:
$$
\left\langle \Delta^{\mathrm{SGD}}W \right\rangle_{z} = \Delta^{\mathrm{GD}}W. \tag{4}
$$
因此,当学习率$\eta>0$足够小以抑制SGD的方差(该方差继承自$z$的随机性)时,SGD为最小化目标函数提供了一种有效的学习算法。

权重扰动和节点扰动是零阶方法,它们通过使用数值微分避免显式计算导数。具体而言,权重扰动(WP)\[4 (https://arxiv.org/html/2607.06079#bib.bib23)\]如下近似SGD中的导数$\frac{\partial \ell(W;z)}{\partial W}$:
$$
\Delta^{\mathrm{WP}}W = -\eta \frac{\ell(W+\alpha\Xi;z) - \ell(W;z)}{\alpha} \Xi, \tag{5}
$$
其中$\Xi$是一个与$W$大小相同的扰动矩阵,其元素满足
$$
\langle \Xi_{ij} \Xi_{kl} \rangle_{\Xi} = \delta_{ik}\delta_{jl}, \tag{6}
$$
且$\alpha>0$是扰动的尺度参数。对于足够小的$\alpha$,WP在平均意义上近似SGD:
$$
\left\langle \Delta^{\mathrm{WP}}W \right\rangle_{\Xi} = \left\langle -\eta \frac{\ell(W+\alpha\Xi;z) - \ell(W;z)}{\alpha} \Xi \right\rangle_{\Xi} \tag{7}
$$
$$
\approx -\eta \left\langle \left( \sum_{ij} \frac{\partial \ell(W;z)}{\partial W_{ij}} \Xi_{ij} \right) \Xi \right\rangle_{\Xi} \tag{8}
$$
$$
= -\eta \frac{\partial \ell(W;z)}{\partial W} \tag{9}
$$
$$
= \Delta^{\mathrm{SGD}}W. \tag{10}
$$
因此,当学习率$\eta>0$足够小以抑制WP的方差(该方差继承自$\Xi$的随机性,以及$z$的随机性)时,WP为最小化目标函数提供了一种有效的学习算法。

节点扰动(NP)\[3 (https://arxiv.org/html/2607.06079#bib.bib24)\]遵循与WP类似的原理,但通过利用待近似导数的结构使用较低维度的扰动。NP假设瞬时损失$\ell(W;z)$具有以下形式
$$
\ell(W;z) = \ell(y), \qquad y = Wz. \tag{11}
$$
当$W$代表网络连接并且输出$y = Wz$(而非$W$本身)被直接评估时,这一假设自然成立。在此假设下,SGD中的导数具有以下结构:
$$
\Delta^{\mathrm{SGD}}W = -\eta \frac{\partial \ell(W;z)}{\partial W} = -\eta \frac{\partial \ell(y)}{\partial y} z^{\top}. \tag{12}
$$
NP如下近似SGD中的导数$\frac{\partial \ell(y)}{\partial y}$:
$$
\Delta^{\mathrm{NP}}W = -\eta \frac{\ell(y+\alpha\xi) - \ell(y)}{\alpha} \xi z^{\top}, \tag{13}
$$
其中$\xi$是与$y=Wz$大小相同的扰动向量,其元素满足
$$
\langle \xi_{i} \xi_{j} \rangle_{\xi} = \delta_{ij}. \tag{14}
$$
通过与WP的式(7 (https://arxiv.org/html/2607.06079#S2.E7))相同的论证,对于足够小的$\alpha$,NP在平均意义上近似SGD。因此,当学习率$\eta>0$足够小以抑制NP的方差(该方差继承自$\xi$的随机性,以及$z$的随机性)时,NP为最小化目标函数提供了一种有效的学习算法。特别地,当扰动向量$\xi$的维度小于扰动矩阵$\Xi$的条目数时,NP可以比WP具有更低的方差。这可以从以下事实理解:WP中每个权重需要独立的扰动,而NP中每个输出节点只需要一个扰动。因此,NP的方差缩放阶数小于WP。

相似文章

储层学习与产出的进化算法

arXiv cs.AI

介绍了EARLY,一个用于进化多储层回声状态网络的进化框架,它在时序学习任务上优于随机搜索,并展现出任务依赖的结构差异。

基于边际自校正的大规模快速遗忘

arXiv cs.LG

介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。

EchoDistill: 对齐噪声到干净的自蒸馏用于鲁棒音频大语言模型

arXiv cs.CL

EchoDistill 是一种基于对齐的噪声到干净的自蒸馏框架,通过使用冻结的干净音频教师模型,利用组相对策略优化 (GRPO) 指导学生模型,从而提高音频大语言模型 (ALLMs) 在现实噪声下的鲁棒性。实验表明,在强噪声下,该方法显著提升了语义可靠性和任务性能,且无需额外推理成本。