并非所有时间步都同等重要:脉冲神经网络的选择性对齐知识蒸馏

arXiv cs.LG 论文

摘要

提出针对脉冲神经网络的选择性对齐知识蒸馏(SeAl-KD),该方法通过均衡错误时间步上的竞争logits并基于置信度和时间步间相似性重新加权时间对齐,选择性地对齐类别级别和时间知识,在静态和神经形态数据集上相较于现有蒸馏方法实现了一致的改进。

arXiv:2605.14252v1 Announce Type: new 摘要:脉冲神经网络(SNNs)受大脑启发且由脉冲驱动,具有高能效。然而,SNNs与人工神经网络(ANNs)之间仍存在性能差距。知识蒸馏(KD)常被用于提升SNN性能,但现有方法通常对所有时间步施加统一对齐,无论是来自教师网络还是通过时间间自蒸馏,这隐含地假设每个时间步的预测都应被同等对待。实际上,SNN的预测随时间变化和演化,即使最终聚合输出正确,中间时间步也无需全部单独正确。在这种情况下,有效的蒸馏不应强制每个时间步朝向相同的监督目标,而应在保留有用时间动态的同时,为错误时间步提供纠正性指导。为解决这一问题,我们提出选择性对齐知识蒸馏(SeAl-KD),该方法通过均衡错误时间步上的竞争logits并基于置信度和时间步间相似性重新加权时间对齐,选择性地对齐类别级别和时间知识。在静态图像和神经形态事件数据集上的大量实验表明,该方法相较于现有蒸馏方法实现了一致的改进。代码可在 https://github.com/KaiSUN1/SeAl 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:28

# 并非所有时间步都同等重要:选择式对齐知识蒸馏用于脉冲神经网络

来源: https://arxiv.org/html/2605.14252
\\newcolumntype

P\[1\]¿\\arraybackslashp\#1

## 并非所有时间步都同等重要:选择式对齐知识蒸馏用于脉冲神经网络

Peibo Duan¹∗, Yongsheng Huang², Guowei Zhang¹, Benjamin Smith¹, Nanxu Gong³, & Levin Kuhlmann¹
1 澳大利亚莫纳什大学信息技术学院
2 中国东北大学软件学院
3 新加坡国立大学医学院
\{kai\.sun1, peibo\.duan, levin\.kuhlmann\}@monash\.edu
通讯作者。

###### 摘要

脉冲神经网络(SNNs)受大脑启发,以脉冲驱动方式运行,具有高能效。然而,SNNs 与人工神经网络(ANNs)之间仍存在性能差距。知识蒸馏(KD)常用于提升 SNN 性能,但现有方法通常强制所有时间步进行统一对齐(无论是来自教师网络还是通过时间自蒸馏),隐含地假设每个时间步的预测应被平等对待。实际上,SNN 的预测会随时间变化和演化,即使最终聚合输出正确,中间时间步也未必都需要单独正确。在这种情况下,有效的蒸馏不应将每个时间步都推向相同的监督目标,而应在保留有用时间动态的同时,为错误的时间步提供纠正性指导。为解决此问题,我们提出了**选择式对齐知识蒸馏**(SeAl-KD),通过均衡错误时间步的竞争对数几率,并根据置信度和时间步间相似性重新加权时间对齐,从而选择性地对齐类别级和时间级知识。在静态图像和神经形态事件驱动数据集上的大量实验表明,该方法相较于现有蒸馏方法取得了持续改进。代码可在 https://github.com/KaiSUN1/SeAl 获取。

## 1 引言

脉冲神经网络(SNNs)常被视为第三代神经网络,是一种生物启发模型,通过离散脉冲而非连续值激活进行通信(Maass (1997 (https://arxiv.org/html/2605.14252#bib.bib41)))。由于以事件驱动方式处理信息,随时间使用稀疏脉冲,SNNs 在部署于神经形态硬件时具有高能效潜力(Guo et al. (2023 (https://arxiv.org/html/2605.14252#bib.bib12)))。然而,训练 SNNs 达到与人工神经网络(ANNs)相当的精度仍然具有挑战性,因为有用证据通过脉冲逐步积累,使得不同时间步在学习过程中的信息量不均(Bellec et al. (2018 (https://arxiv.org/html/2605.14252#bib.bib57)); Neftci et al. (2019 (https://arxiv.org/html/2605.14252#bib.bib59)))。

为缩小 ANNs 与 SNNs 之间的性能差距,知识蒸馏(KD)已成为广泛采用的策略(Xu et al. (2023 (https://arxiv.org/html/2605.14252#bib.bib3)); Qiu et al. (2024 (https://arxiv.org/html/2605.14252#bib.bib7)))。早期的蒸馏方法通常仅通过匹配平均对数几率来监督最终聚合输出,这可能在优化过程中混合不一致的时间信息(Zhao et al. (2025 (https://arxiv.org/html/2605.14252#bib.bib26)); Deng et al. (2022 (https://arxiv.org/html/2605.14252#bib.bib28)))。更近期的方法转向时间步级蒸馏,在每个时间步注入教师监督并对齐整个时间维度上的对数几率(Yu et al. (2025b (https://arxiv.org/html/2605.14252#bib.bib15), a (https://arxiv.org/html/2605.14252#bib.bib16)))。与此并行,一些方法进一步利用 SNN 的时间结构进行自蒸馏(Ding et al. (2025b (https://arxiv.org/html/2605.14252#bib.bib2)))或时间一致性正则化(Zhao et al. (2025 (https://arxiv.org/html/2605.14252#bib.bib26)); Ding et al. (2025a (https://arxiv.org/html/2605.14252#bib.bib27))),鼓励不同时间步的预测或特征保持一致性,以稳定优化并提升性能(Ding et al. (2025b (https://arxiv.org/html/2605.14252#bib.bib2)); Yu et al. (2025b (https://arxiv.org/html/2605.14252#bib.bib15)))。

一致性假设与 SNN 的内在属性及其预测机制部分不符。由于膜电位积分和重置,脉冲发放可能导致膜状态的突变,使得 SNN 难以在所有时间步维持相同的预测,详见附录 A (https://arxiv.org/html/2605.14252#A1)。同时,由于最终决策由时间积累而非单个时间步决定,错误的中间预测并不一定意味着最终结果错误。如图 1 (https://arxiv.org/html/2605.14252#S1.F1)(a) 中的简单示例所示,某些中间时间步分类错误,但最终时间聚合预测正确。图 1 (https://arxiv.org/html/2605.14252#S1.F1)(b) 进一步显示,每个时间步的准确率始终低于时间聚合准确率。此外,图 1 (https://arxiv.org/html/2605.14252#S1.F1)(c) 揭示,超过 12% 的正确分类样本在某些中间时间步被误分类,且部分样本从未在任何单个时间步被正确分类,但在时间聚合后仍变为正确。这些观察表明,对一个时间步的评价不应仅基于其当前是否正确,而应考虑它是否为最终的时间积累贡献了有用证据。

参考说明图 1: SNN 中中间预测与最终预测的不匹配。(a) 一个简单示例,中间预测错误但最终聚合预测正确。(b) CIFAR100 上每个时间步的准确率与最终聚合准确率。(c) CIFAR100 中最终预测正确的样本,按 T 个时间步中正确预测的时间步数量分布。

然而,现有的时间步级蒸馏策略并未明确考虑这一区别。通过鼓励每个时间步与教师信号对齐,它们可能忽略实际需要哪些纠正性证据来改进时间积累,以及哪些时间源能够提供可靠支持。这一观点引出了时间步级蒸馏的两个关键问题:**应该向当前错误的时间步注入哪些纠正性证据**,以及**应该从哪些时间源中提取这些证据**?对于当前被混淆错误类别主导的错误时间步,直接转移教师对整个类别分布的偏好可能会稀释所需的纠正,并干扰最关键类别关系(即真实类别与错误偏好类别之间)的调整。此外,在时间自蒸馏中,并非所有源时间步都同样可靠:有些提供自信且兼容的证据,而另一些可能引入噪声或误导性的时间信号。为解决这些问题,我们提出了 SeAl-KD,一个包含两个组件的选择性蒸馏框架:**误差感知对数几率对齐(ELA)** 改进了错误时间步接收的类别证据,而**选择性时间对齐(STA)** 在对齐过程中强调可靠且兼容的源时间步。

参考说明图 2: SeAl-KD 框架。SNN 在所有时间步从相同的复制 ANN 输出中学习。ELA 在错误时间步处均衡真实对数几率和预测错误对数几率,然后进行师生 KL 散度。STA 使用置信度和时间步间相似性重新加权时间 KL 散度。C 表示真实类别。左下角图示说明,我们的方法旨在遵循时间多样性以获得正确预测,即使某些中间预测不正确。我们的主要贡献总结如下:(1) 我们揭示了错误时间步在 SNN 中普遍存在,并表明中间误分类在时间聚合下并不一定会损害最终预测,暴露了一致性与时间证据积累之间的不匹配。(2) 我们提出了 SeAl-KD,一个通过 ELA 和 STA 改善错误时间步纠正性监督的选择性 KD 框架,并提供了理论分析以证明所提出的选择性对齐的合理性。(3) 我们在静态图像和神经形态图像数据集上进行了大量实验。结果表明,SeAl-KD 在时间步间保留了更丰富的时间分布,并持续提升了性能。

## 2 相关工作

### 2.1 脉冲神经网络的知识蒸馏

KD 通过从 ANN 转移最终输出、对数几率或特征来改进 SNN 训练,以缩小与实值 ANN 的差距 (Xu et al. (2023 (https://arxiv.org/html/2605.14252#bib.bib3)); Hong et al. (2025 (https://arxiv.org/html/2605.14252#bib.bib4)))。沿着这条路线,蒸馏策略已经从对时间聚合输出的全局监督 (Zhang et al. (2025 (https://arxiv.org/html/2605.14252#bib.bib6))) 演变为在每个时间步对齐对数几率或表示的时间步级监督 (Yu et al. (2025b (https://arxiv.org/html/2605.14252#bib.bib15), a (https://arxiv.org/html/2605.14252#bib.bib16)))。此外,自蒸馏和时间一致性正则化进一步利用学生的时间结构来对齐不同时间步的输出 (Qiu et al. (2024 (https://arxiv.org/html/2605.14252#bib.bib7)); Zuo et al. (2024 (https://arxiv.org/html/2605.14252#bib.bib13)))。尽管取得了这些进展,大多数现有方法以大体上统一的方式对不同时间步施加监督,而未区分该时间步当前是否错误、它实际需要哪些纠正信息,或者用于监督的时间源是否可靠。

### 2.2 脉冲神经网络中的时间差异

时间差异是 SNN 的内在特性,因为膜积分和脉冲触发的重置导致神经元状态和预测随时间步演化 (Bellec et al. (2018 (https://arxiv.org/html/2605.14252#bib.bib57)))。先前的工作通过可学习的膜动力学 (Fang et al. (2021 (https://arxiv.org/html/2605.14252#bib.bib9)))、时间归一化 (Zheng et al. (2021 (https://arxiv.org/html/2605.14252#bib.bib29)); Duan et al. (2022 (https://arxiv.org/html/2605.14252#bib.bib8))) 和代理梯度设计 (Li et al. (2021b (https://arxiv.org/html/2605.14252#bib.bib58)); Wang et al. (2023 (https://arxiv.org/html/2605.14252#bib.bib10))) 改进了时间建模和训练稳定性。一些研究进一步通过时间步依赖的权重 (Deng et al. (2022 (https://arxiv.org/html/2605.14252#bib.bib28))) 或跨时间步的时间一致性正则化 (Zhao et al. (2025 (https://arxiv.org/html/2605.14252#bib.bib26)); Ding et al. (2025a (https://arxiv.org/html/2605.14252#bib.bib27))) 来利用时间结构。然而,这些方法大多以统一方式调节时间差异,未明确考虑每个时间步在最终时间聚合预测中的作用。因此,它们未区分一个时间步需要何种监督,或哪些时间源能可靠地提供监督。

## 3 预备知识

##### 时间步级蒸馏。

考虑一个在 T 个时间步上展开的 SNN。在时间步 t,学生 SNN 模型(以上标 S 表示)产生一个对数几率向量 z_t^S ∈ ℝ^C,其中 C 表示类别数。最终预测通常通过对所有时间步的对数几率进行时间平均得到,而每个 z_t^S 也可被视为一个中间预测。对于相同的输入,教师 ANN 模型(以上标 A 表示)产生一个时间不变的对数几率向量 z^A。相应的类别分布由温度缩放 softmax 函数给出:p_t^S = softmax(z_t^S / τ) 和 p^A = softmax(z^A / τ),其中 τ > 0 是温度。在 p_t^S 和 p^A 下类别 i 的概率分别记为 p_{t,i}^S 和 p_i^A。

对于每个时间步 t,学生通过两个目标进行优化。第一个目标 L_CLS 在每个时间步应用交叉熵(CE)损失进行分类监督:

L_CLS = (1/T) ∑_{t=1}^T ℓ_CE(z_t^S, y) = (1/T) ∑_{t=1}^T ( -∑_{i=1}^C y_i log p_{t,i}^S ),   (1)

其中 y ∈ {0,1}^C 是 one-hot 真实标签。

第二个目标 L_KD 使用 Kullback-Leibler (KL) 散度将每个时间步输出与相同的教师分布对齐:

L_KD = (1/T) ∑_{t=1}^T KL( p^A ∥ p_t^S ) = (1/T) ∑_{t=1}^T ∑_{i=1}^C p_i^A log (p_i^A / p_{t,i}^S).   (2)

整体训练目标 L 定义为

L = L_CLS + λ L_KD,   (3)

其中 λ 控制蒸馏项的贡献。

## 4 方法

本节介绍 SeAl-KD,它由 ELA 和 STA 组成。如图 2 (https://arxiv.org/html/2605.14252#S1.F2) 所示,ELA 在错误时间步改进类别级别的纠正,而 STA 选择置信且兼容的时间源进行对齐。

### 4.1 误差感知对数几率对齐蒸馏

ELA 执行时间步级蒸馏,同时考虑 SNN 中跨时间步的预测误差。令 y* ∈ {1,...,C} 表示对应于 one-hot 标签 y 的真实类别索引,令 z_{t,c}^S 和 z_{t,c}^A 分别表示学生和教师在时间步 t 对于类别 c 的对数几率。学生在时间步 t 的预测为 c_t^pred = argmax_c z_{t,c}^S。当一个中间时间步错误时,ELA 放松对其主要混淆的蒸馏,而不是直接强制执行正确的类别排序,避免在混淆类别对上产生误导性纠正,同时保持对其他类别的监督。

##### 对数几率修改。

如果 c_t^pred ≠ y*,我们关注由真实类别 y* 和预测错误类别 c_t^false = c_t^pred 组成的类别对。我们仅均衡这对的对数几率,并保持其余类别不变。具体来说,y* 和 c_t^false 的对数几率均设置为它们原始值的最小值,这避免了引入不必要的绝对偏移。修改后的学生和教师对数几率,分别记为 \tilde{z}_{t,c}^S 和 \tilde{z}_{t,c}^A,定义为

\tilde{z}_{t,c}^S = \begin{cases}
min( z_{t,y*}^S, z_{t,c_t^false}^S ), & c ∈ \{y*, c_t^false\},\\
z_{t,c}^S, & 否则。
\end{cases}

相似文章

重新思考逆向KL作为自适应熵蒸馏

arXiv cs.LG

本文提出了自适应熵蒸馏(AED)方法,该方法利用教师熵动态校准知识蒸馏中的词元级模仿强度,在指令跟随和数学推理基准测试上取得了卓越性能。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。