温度自适应 Transformed Teacher Matching
摘要
本文提出了一种用于知识蒸馏中Transformed Teacher Matching的样本级自适应温度缩放方法,通过局部最小化教师和学生分布之间的KL散度,在图像分类基准上提升性能。
arXiv:2608.29099v1 宣布类型:新
摘要:温度缩放是知识蒸馏的核心组成部分,但其作用和效果尚未完全理解。Transformed Teacher Matching (TTM) 通过仅将其应用于教师分布并解释为带有学生隐式Rényi熵正则化的标准蒸馏,阐明了温度缩放的作用。然而,TTM仍然依赖于固定温度,并未指定教师端温度应如何针对单个样本进行自适应。本文提出了一种用于TTM的样本级逆温度更新,通过局部最小化温度缩放后的教师分布与学生预测之间的Kullback-Leibler散度。我们推导了关于逆温度的闭式一阶和二阶导数,并证明它们可以使用转换教师权重下居中教师和学生logits的方差和协方差统计量来表示。这产生了一种高效的曲率感知更新,需要一次softmax评估和固定数量的类别级加权求和。在标准图像分类蒸馏基准上的实验表明,我们的温度自适应通常改进了TTM和WTTM,同时与先前的自适应温度蒸馏基线保持竞争力或优于它们。
查看缓存全文
缓存时间: 2026/09/01 13:08
# 温度自适应变换教师匹配 来源:https://arxiv.org/html/2608.29099 温度自适应TTM ## 温度自适应变换教师匹配 Yoshikazu Hayashi\orcidlink0009-0000-6251-3950Hiroaki AizawaYoshikazu Hayashi ###### 摘要 温度缩放是知识蒸馏的核心组成部分,但其作用和效果尚未完全明晰。变换教师匹配(TTM)通过仅对教师分布应用温度缩放,并将所得目标函数解释为对学生具有隐式Rényi熵正则化的标准蒸馏,从而阐明了温度缩放的作用。然而,TTM仍依赖于固定温度,未指明教师侧温度应如何针对个体样本进行适应。本文通过局部最小化温度缩放后的教师分布与学生预测之间的Kullback-Leibler散度,为TTM引入了一种逐样本的逆温度更新方法。我们推导了关于逆温度的一阶和二阶闭式导数,并表明这些导数可以利用变换教师加权下居中教师与学生logits的方差与协方差统计量来表示。这产生了一种高效的曲率感知更新,仅需一次softmax评估和恒定数量的按类别加权求和。在标准图像分类蒸馏基准上的实验表明,我们的温度适应方法普遍提升了TTM和WTTM的性能,同时与先前的温度自适应蒸馏基线方法相比保持竞争力或优于它们。 ††email:[email protected]††email:[email protected]††affiliation:Graduate School of Advanced Science and Engineering Hiroshima University, Japan ††affiliation:Intelligent Production Technology Research & Development Center for Aerospace Gifu University, Japan ## 1引言 知识蒸馏(KD)通过从教师模型向学生模型传递知识来训练学生模型,在不增加推理成本的情况下提高准确性\[12 (https://arxiv.org/html/2608.29099#bib.bib1)\]。当训练资源或高质量标注数据有限时,这一范式尤其有价值,因为它能够以更小的模型预算提供强大的性能。然而在实践中,KD的有效性取决于若干设计选择,这些选择可能对教师、学生和数据集敏感,并且常常需要仔细调整。 请参阅图例图1:提出的温度自适应变换教师匹配概述。给定一个输入样本,教师产生一个预测分布,该分布通过带有自适应逆温度\(\gamma\)的幂变换进行校准。逆温度\(\gamma\)被更新以获得用于蒸馏的样本自适应软目标。学生使用交叉熵和一个蒸馏损失进行训练,该损失使学生预测与适应后的教师分布匹配。标准KD的核心组成部分是温度缩放,它平滑预测分布以揭示类别间关系,常被称为暗知识。在常见的公式中\[12 (https://arxiv.org/html/2608.29099#bib.bib1)\],温度缩放应用于教师和学生输出,学生被训练以匹配所得的软化分布。这种平滑处理为非最大类别分配了有意义的概率质量与梯度,使得学生更容易学习教师的相对类别结构。尽管经验上成功,温度缩放在KD中的作用尚不明确,且历史上对于是否对教师、学生或两者应用温度的设计选择是模糊的。 变换教师匹配(TTM)\[37 (https://arxiv.org/html/2608.29099#bib.bib2)\]通过仅对教师分布使用温度缩放,并将变换后的教师分布与学生的无温度预测进行匹配,从而消除了蒸馏目标中的这一模糊性。除了目标层面的澄清,TTM还提供了蒸馏中温度的原则性解释。通过幂变换重新表述教师侧的温度变换,它表明所得目标将分布匹配与对学生隐式的Rényi熵正则化相结合。 温度缩放也广泛应用于蒸馏之外的领域,包括校准\[10 (https://arxiv.org/html/2608.29099#bib.bib18)\]、分布外检测\[18 (https://arxiv.org/html/2608.29099#bib.bib19)\]、半监督和自监督学习\[6 (https://arxiv.org/html/2608.29099#bib.bib20),5 (https://arxiv.org/html/2608.29099#bib.bib21),26 (https://arxiv.org/html/2608.29099#bib.bib22),4 (https://arxiv.org/html/2608.29099#bib.bib23)\]以及带标签噪声的学习\[16 (https://arxiv.org/html/2608.29099#bib.bib24)\]。在这些环境中,温度会显著影响优化行为和最终性能。然而在实践中,选择有效的温度通常取决于特定的教师、学生和数据集,并且通常通过经验调整来选择。虽然TTM通过仅在教师侧应用温度缩放来澄清了目标,但它仍然依赖于固定温度,并未指明教师侧温度应如何跨样本变化。 在本文中,我们通过引入TTM的逐样本温度适应方法来解决这一局限性。我们的方法通过局部最小化变换后的教师分布与学生预测之间的Kullback-Leibler散度,优化每个样本的教师侧逆温度(图1 (https://arxiv.org/html/2608.29099#S1.F1))。我们推导了关于逆温度的一阶和二阶闭式导数,并表明它们可以写成变换教师加权下居中教师与学生logits的紧凑方差-协方差表达式。这些导数导致一种高效的曲率感知更新,增加的开销可忽略不计,并且可以直接集成到TTM和WTTM中。因此,所提出的方法在适应教师目标的同时保留了TTM框架,从而在样本层面适应了隐式的Rényi熵正则化。在标准图像分类蒸馏基准上的实验表明,我们的温度适应方法普遍提升了TTM和WTTM的性能,同时与先前的温度自适应蒸馏基线方法相比保持竞争力或优于它们。 ## 2相关工作 知识蒸馏(KD)通过匹配教师模型和学生模型的预测分布,将知识从教师模型转移到学生模型,在不增加推理成本的情况下提高准确性\[12 (https://arxiv.org/html/2608.29099#bib.bib1)\]。先前的工作探索了多样的传递信号,包括基于特征的蒸馏\[23 (https://arxiv.org/html/2608.29099#bib.bib4),34 (https://arxiv.org/html/2608.29099#bib.bib5),1 (https://arxiv.org/html/2608.29099#bib.bib6)\]、关系与相似性匹配方法\[21 (https://arxiv.org/html/2608.29099#bib.bib9),20 (https://arxiv.org/html/2608.29099#bib.bib8),29 (https://arxiv.org/html/2608.29099#bib.bib7)\]以及用于表示蒸馏的对比目标\[27 (https://arxiv.org/html/2608.29099#bib.bib10)\]。在logits方面,大量工作通过改进目标分布或损失公式来提升蒸馏效果\[35 (https://arxiv.org/html/2608.29099#bib.bib12),13 (https://arxiv.org/html/2608.29099#bib.bib11)\],而自蒸馏提供了一个互补的方向\[9 (https://arxiv.org/html/2608.29099#bib.bib13)\]。 温度缩放是KD的核心,也广泛应用于相关领域,如校准\[10 (https://arxiv.org/html/2608.29099#bib.bib18)\]、分布外检测\[18 (https://arxiv.org/html/2608.29099#bib.bib19)\]以及半监督或自监督学习\[6 (https://arxiv.org/html/2608.29099#bib.bib20),5 (https://arxiv.org/html/2608.29099#bib.bib21),26 (https://arxiv.org/html/2608.29099#bib.bib22),4 (https://arxiv.org/html/2608.29099#bib.bib23)\]。近期的KD方法通过引入课程温度调度\[17 (https://arxiv.org/html/2608.29099#bib.bib16)\]、logit标准化\[25 (https://arxiv.org/html/2608.29099#bib.bib14)\]、基于熵的适应\[24 (https://arxiv.org/html/2608.29099#bib.bib15)\]以及基于预训练教师难度的预计算样本级温度\[32 (https://arxiv.org/html/2608.29099#bib.bib17)\]来适应温度。与温度适应相反,变换教师匹配(TTM)仅对教师分布应用温度缩放,并表明所得公式可以视为对学生具有隐式Rényi熵正则化的标准蒸馏\[37 (https://arxiv.org/html/2608.29099#bib.bib2)\]。WTTM通过基于样本的加权进一步扩展TTM,以强调有信息量的教师信号\[37 (https://arxiv.org/html/2608.29099#bib.bib2)\]。我们的工作通过在TTM框架内,利用从教师-学生不匹配的闭式一阶和二阶导数推导出的曲率感知更新,在样本级别适应教师侧逆温度,从而补充了TTM和WTTM。 ## 3预备知识 ### 3.1设置与符号 我们考虑知识蒸馏设置下的\(K\)类分类问题。给定一个输入-标签对\((\mathbf{x}, y)\),其中\(y \in \{1, \dots, K\}\),我们使用真实标签和由教师模型\(f_t(\cdot; \theta_t)\)产生的教师预测分布来训练学生模型\(f_s(\cdot; \theta_s)\)。教师参数\(\theta_t\)在蒸馏过程中是固定的,而学生参数\(\theta_s\)被优化。令教师和学生模型分别产生logits \(\mathbf{z}_t = f_t(\mathbf{x}; \theta_t) \in \mathbb{R}^K\)和\(\mathbf{z}_s = f_s(\mathbf{x}; \theta_s) \in \mathbb{R}^K\)。相应的无温度预测分布为 \[ p = \mathrm{softmax}(\mathbf{z}_t), \qquad q = \mathrm{softmax}(\mathbf{z}_s), \tag{1} \] 其中\(\bigl(\mathrm{softmax}(\mathbf{z})\bigr)_i = \exp(z_i) \big/ \sum_{j=1}^K \exp(z_j)\)。当模型参数依赖性重要时,我们写作\(p_{\theta_t} = \mathrm{softmax}(f_t(\mathbf{x}; \theta_t))\)和\(q_{\theta_s} = \mathrm{softmax}(f_s(\mathbf{x}; \theta_s))\);否则,为简洁起见,我们使用\(p\)和\(q\)。 对于蒸馏,我们引入一个温度参数\(T > 0\)来控制预测分布的尖锐度(或平滑度)。具体来说,我们定义温度缩放后的教师和学生分布为 \[ p_T = \mathrm{softmax}(\mathbf{z}_t / T), \qquad q_T = \mathrm{softmax}(\mathbf{z}_s / T). \tag{2} \] 我们使用\(\mathcal{L}_{\mathrm{CE}}(\cdot, \cdot)\)表示交叉熵损失,\(D_{\mathrm{KL}}(\cdot \| \cdot)\)表示Kullback-Leibler散度。 ### 3.2知识蒸馏与变换教师匹配 #### 知识蒸馏(KD)\[12 (https://arxiv.org/html/2608.29099#bib.bib1)\]。 KD通过结合监督学习与温度缩放后的教师和学生预测之间的分布匹配来训练学生。一个常见的公式是 \[ \mathcal{L}_{\mathrm{KD}} = (1 - \lambda) \, \mathcal{L}_{\mathrm{CE}}(y, q) + \lambda T^2 \, D_{\mathrm{KL}}(p_T \| q_T), \tag{3} \] 其中\(\lambda \in [0, 1]\)平衡监督项和蒸馏项。 #### 变换教师匹配(TTM)\[37 (https://arxiv.org/html/2608.29099#bib.bib2)\]。 为了阐明教师侧温度的作用,TTM将温度缩放解释为一种*幂变换*。给定无温度的教师预测\(p\),我们定义幂变换分布 \[ p^{(\gamma)}_i = \frac{p_i^\gamma}{\sum_{j=1}^K p_j^\gamma}, \qquad \gamma > 0. \tag{4} \] 通过设定\(\gamma = 1/T\),我们得到等价关系\(p_T = p^{(\gamma)}\),并且我们直接从logits计算\(p^{(\gamma)}\)为 \[ p^{(\gamma)} = \mathrm{softmax}(\gamma \, \mathbf{z}_t). \tag{5} \] 基于幂变换的观点,TTM明确建立了与标准KD目标的联系。具体来说,通过参数对应关系\(\gamma = 1/T\)和\(\beta = \frac{\lambda}{1 - \lambda} T\),TTM损失可以重写为 \[ \mathcal{L}_{\mathrm{TTM}} = \mathcal{L}_{\mathrm{CE}}(y, q) + \beta \, D_{\mathrm{KL}}(p^{(\gamma)} \| q) = \frac{1}{1 - \lambda}\Bigl[\mathcal{L}_{\mathrm{KD}} - \lambda T (T - 1) \, \mathcal{H}_{1/T}(q) \Bigr], \tag{6} \] 其中\(\mathcal{H}_{\alpha}(q)\)表示阶数为\(\alpha\)的Rényi熵\[22 (https://arxiv.org/html/2608.29099#bib.bib3)\]。这个等式强调了TTM不仅是一个分布匹配目标,而且还引入了对学生预测的隐式Rényi熵正则化。 #### 加权TTM(WTTM)\[37 (https://arxiv.org/html/2608.29099#bib.bib2)\]。 WTTM通过基于教师目标的尖锐度为蒸馏项分配样本级权重来进一步扩展TTM。具体来说,WTTM将公式(6 (https://arxiv.org/html/2608.29099#S3.E6))中的蒸馏系数\(\beta\)乘以为每个样本计算的权重\(U_\gamma(p)\): \[ \mathcal{L}_{\mathrm{WTTM}} = \mathcal{L}_{\mathrm{CE}}(y, q) + \beta U_\gamma(p) \, D_{\mathrm{KL}}(p_T \| q), \quad U_\gamma(p) = \sum_{j=1}^K p_j^\gamma, \tag{7} \] 其中\(U_\gamma(p)\)是教师分布的幂和,当教师目标更平滑时它会增加,从而对那些暗知识更具信息量的样本赋予更高权重,同时保持教师侧温度不变。 ## 4方法论 ### 4.1概述:TTM的逐样本温度适应 我们解决TTM中剩余的问题:*如何适应教师温度*。我们的目标是在TTM框架内实现样本自适应的温度缩放。为此,我们在固定logits的情况下优化每个输入的逆温度\(\gamma = 1/T\)。具体来说,我们构造教师分布\(p^{(\gamma)} = \mathrm{softmax}(\gamma \, \mathbf{z}_t)\)和学生预测\(q = \mathrm{softmax}(\mathbf{z}_s)\),并最小化逐样本TTM差异\(D_{\mathrm{KL}}\bigl(p^{(\gamma)} \| q\bigr)\)。 #### KL差异的局部敏感性和曲率。 为了理解教师温度如何影响TTM,*即*量化教师侧逆温度\(\gamma\)如何在样本层面影响TTM,我们分析了\(D_{\mathrm{KL}}\bigl(p^{(\gamma)} \| q\bigr)\)在小扰动\(\Delta \gamma\)下的局部行为。这个差异是TTM中的教师-学生匹配项,其值在训练过程中随着学生预测的变化可能在样本间发生显著变化。因此,它的
相似文章
知识蒸馏中一致性信息丰富的软标签温度
提出CIST方法,在知识蒸馏中为教师和学生分配独立的样本自适应温度,生成一致性信息丰富的软标签,并放宽严格的logit尺度匹配。在视觉和语言任务上的实验表明,相比标准KD具有一致的改进。
重新思考温度在大语言模型蒸馏中的作用
本文重新审视了温度在大语言模型蒸馏中的作用,揭示出温度不对称地更有利于正向KL散度而非反向KL,使得简单的KL方法在较高温度下能够匹敌当前最先进的蒸馏方法。
扩展模型生成的蒸馏数据可使潜在教师特质更易恢复
本文表明,扩展任务外模型生成的蒸馏数据可以放大学生的潜在教师特质,即使数据看似无害,这表明在AI训练中需要特质感知的筛选。
重新思考逆向KL作为自适应熵蒸馏
本文提出了自适应熵蒸馏(AED)方法,该方法利用教师熵动态校准知识蒸馏中的词元级模仿强度,在指令跟随和数学推理基准测试上取得了卓越性能。
知识蒸馏在教师误指定下的秩序参数分析:教师模仿与任务表现之间的差距
本文采用秩序参数方法分析了教师误指定下知识蒸馏中教师模仿与真实任务表现之间的差距,表明模仿指标可能保持不变,而真实误差随失配程度增加。