BP-TTA: 动态场景下基于平衡与原型指导的测试时自适应
摘要
提出BP-TTA,一种通过结合批次平衡采样与原型指导约束来处理类别不平衡和持续域偏移的测试时自适应方法,在动态流式场景中实现了最先进的性能。
arXiv:2606.31420v1 公告类型:新
摘要:测试时自适应(TTA)使在源域上训练的模型能够在分布偏移下在线适应未标记的测试数据。虽然最近的TTA方法已超越静态设置并开始考虑持续域偏移,但它们主要解决分布漂移问题,未能考虑动态场景中的类别不平衡。在实际测试时数据流中,类别不平衡和持续域偏移通常同时出现并相互影响。本文提出了一种新型的平衡与原型指导测试时自适应(BP-TTA)方法,该方法结合了批次平衡采样与原型指导自适应,以处理类别不平衡和持续域偏移问题。BP-TTA通过整合当前样本与高置信度历史实例来构建平衡的自适应批次,有效减轻对主导类别的偏向并稳定在线更新。同时,BP-TTA在推理过程中维护演化的类原型,并利用原型相似性作为模型自适应的约束,从而在持续域偏移下提高伪标签的可靠性并增强在线更新的稳定性。大量实验表明,在动态测试时流式设置中,BP-TTA始终优于最先进的TTA方法。
查看缓存全文
缓存时间: 2026/07/01 05:38
# BP-TTA:动态场景下的平衡与原型引导测试时适应 来源:https://arxiv.org/html/2606.31420 Shaoyang Huang, Yashi Zhu, Yichen Yu, Lei Zhang, Zhang Yi, , Tao He* 本工作受教育部基础与交叉学科突破计划(批准号:JYB2025XDXM101)和四川省自然科学基金(批准号:2026NSFSC1488)资助。(通讯作者:陶 贺,邮箱:[email protected])。Shaoyang Huang, Yashi Zhu, Yichen Yu和Zhang Yi来自四川大学计算机学院,成都,610065。陶贺和Lei Zhang来自四川大学人工智能学院,成都,610065。Shaoyang Huang和Yashi Zhu为本文的共同第一作者,对研究贡献相等。###### 摘要 测试时适应(TTA)使得在源域上训练的模型能够在分布偏移下在线适应未标记的测试数据。虽然最近的TTA方法已超越静态设置并开始考虑持续域偏移,但它们主要解决的是分布漂移问题,未能考虑动态场景中的类别不平衡。在现实世界的测试数据流中,类别不平衡和持续域偏移经常同时发生并相互影响。本文提出了一种新颖的平衡与原型引导测试时适应(BP-TTA)方法,该方法将批次平衡采样与原型引导适应相结合,以处理类别不平衡和持续域偏移问题。BP-TTA通过整合当前样本与高置信度的历史实例来构建平衡的适应批次,有效减轻了对主导类别的偏向并稳定了在线更新。同时,BP-TTA在推理过程中维护动态演化的类别原型,并将原型相似性作为模型适应的约束,从而提高了伪标签的可靠性,并增强了在持续域偏移下在线更新的稳定性。大量实验表明,BP-TTA在动态测试流式设置中始终优于最先进的TTA方法。 ## I 引言 深度神经网络近年来在计算机视觉及相关领域取得了显著进展[10 (https://arxiv.org/html/2606.31420#bib.bib2),19 (https://arxiv.org/html/2606.31420#bib.bib1)]。然而,它们的成功通常依赖于训练数据和测试数据服从相同分布的假设,这在现实应用中很少成立。在实践中,光照变化、天气变化、传感器噪声和成像设备差异等因素常常导致分布偏移。当推理时面临此类偏移时,模型性能可能大幅下降,有时甚至导致灾难性失败[9 (https://arxiv.org/html/2606.31420#bib.bib37)]。由于在所有可能的数据分布上训练模型是不可行的,这种对训练分布的依赖限制了其适应性。 为了缓解分布偏移,先前的研究广泛探索了无监督域适应(UDA),它通过对齐标记的源数据和未标记的目标数据进行联合训练来解决域差距[6 (https://arxiv.org/html/2606.31420#bib.bib39),21 (https://arxiv.org/html/2606.31420#bib.bib40),20 (https://arxiv.org/html/2606.31420#bib.bib41),24 (https://arxiv.org/html/2606.31420#bib.bib42)]。然而,它要求在训练期间同时访问源数据和目标数据。在实践中,目标数据往往事先不可得,分布偏移不可预测,并且由于隐私或计算限制,源数据也可能无法获取。 针对这一挑战,测试时适应(TTA)近年来在涉及图像损坏引起的域偏移场景中受到越来越多的关注[4 (https://arxiv.org/html/2606.31420#bib.bib7),18 (https://arxiv.org/html/2606.31420#bib.bib5)]。在这种范式中,预训练的源模型(无法访问其训练数据)通过在线训练适应未标记的测试数据。早期的TTA研究[39 (https://arxiv.org/html/2606.31420#bib.bib23),30 (https://arxiv.org/html/2606.31420#bib.bib34),2 (https://arxiv.org/html/2606.31420#bib.bib36)]主要关注静态适应设置。这些方法假设所有测试样本独立地来自单个固定的目标域,这意味着每个测试批次是独立同分布(i.i.d.)的。在此假设下,模型可以通过最小化熵或更新归一化统计量逐步适应一个固定的目标分布。然而,这种假设在实践中往往不切实际,因为现实世界的测试数据很少遵循固定分布,而是随时间表现出复杂且不断演化的模式。 为了解决这一局限性,后续工作[40 (https://arxiv.org/html/2606.31420#bib.bib24),26 (https://arxiv.org/html/2606.31420#bib.bib25),42 (https://arxiv.org/html/2606.31420#bib.bib8)]提出了持续测试时适应(CTTA),它考虑了一种更现实的动态适应场景,即测试分布在变化环境下随时间持续偏移。此外,[47 (https://arxiv.org/html/2606.31420#bib.bib19)]引入了一种更实用的设置,不仅遵循持续适应范式,还考虑了测试数据通常作为具有强时间相关性的流式序列到达的事实。这通常会导致短时间窗口内严重的类别不平衡。这种设置被称为实用测试时适应(PTTA),它提出了两个关键挑战:类别不平衡和持续域偏移。 首先,当某些类别在短时间内频繁出现而其他类别出现较少或暂时缺席时,就会发生类别不平衡。这种情况通常源于现实世界流式数据的时间相关性。例如,在自动驾驶中,高速公路上的车辆主要观察到汽车,而在居住区则主要遇到行人或非机动车。这种时间局部化的分布会导致有偏的模型更新,因为模型反复从主导类别中学习[32 (https://arxiv.org/html/2606.31420#bib.bib16)]。结果,梯度更新由多数类主导,导致模型过拟合短期模式而忽略少数类,最终降低整体泛化性能。 其次,持续域偏移指的是随着环境条件随时间演变,测试分布逐渐发生变化。例如,在自动驾驶中,当车辆从阳光明媚的道路驶向雨天街道或隧道时,光照会发生变化,导致输入特征随时间偏移[35 (https://arxiv.org/html/2606.31420#bib.bib11)]。在持续域偏移设置下,依赖伪标签或熵最小化的TTA方法往往不稳定,且对噪声信号高度敏感。随着分布漂移,伪标签可能退化,产生有噪声的监督信号,误导梯度更新并降低模型可靠性。 为了联合解决类别不平衡和持续域偏移,我们提出了一种平衡与原型引导测试时适应(BP-TTA)方法,该方法结合了批次平衡采样与原型引导适应。以下是我们的主要贡献: - • 我们提出批次平衡采样(BBS)来解决类别不平衡问题,它从现实测试流中构建一个类别平衡的记忆库,并根据输入样本的类别分布动态重构当前批次,有效缓解了类别不平衡。详细内容如图1a (https://arxiv.org/html/2606.31420#S1.F1.sf1)所示。这种设计确保了每次模型更新都受到高质量、平衡的伪标签的引导,从而提高了动态流中的适应鲁棒性。 - • 我们提出类别原型引导适应(CPGA)来应对持续域偏移,旨在提高伪标签质量并稳定TTA。如图1b (https://arxiv.org/html/2606.31420#S1.F1.sf2)所示,CPGA在测试期间动态维护类别原型,并将特征-原型相似性纳入模型更新,从而在特征空间中实现主动适应。 - • 我们在三个数据集上评估了我们的方法,这些数据流同时存在类别不平衡和持续变化的分布,结果表明我们的方法优于最近的最先进方法。 参见标题 (a) 参见标题 (b) Figure 1: 我们两个关键组件的可视化。(a) BBS 从多数类中选择高质量样本,并从记忆库中补充少数类样本,以构建用于适应的平衡批次。记忆库使用当前批次中的新样本进行选择性更新。(b) CPGA 首先使用高置信度样本的特征(实心三角形)更新类别原型,然后计算原型损失以引导模型适应,促进类内聚类和类间分离。 ## II 相关工作 ### II-A 测试时适应 神经网络已成为人工智能的主要课题,循环模型 [25 (https://arxiv.org/html/2606.31420#bib.bib45), 14 (https://arxiv.org/html/2606.31420#bib.bib49), 13 (https://arxiv.org/html/2606.31420#bib.bib50)] 和基于ODE的方法 [45 (https://arxiv.org/html/2606.31420#bib.bib46), 46 (https://arxiv.org/html/2606.31420#bib.bib47), 12 (https://arxiv.org/html/2606.31420#bib.bib48)] 已在复杂的机器学习任务中得到广泛发展。然而,这些模型在具有持续域偏移的动态场景中表现不佳。 无监督域适应(UDA)旨在使用标记的源域数据训练模型,并泛化到未标记的目标域,解决了分布偏移的挑战,且无需目标域标注 [6 (https://arxiv.org/html/2606.31420#bib.bib39), 21 (https://arxiv.org/html/2606.31420#bib.bib40), 20 (https://arxiv.org/html/2606.31420#bib.bib41), 24 (https://arxiv.org/html/2606.31420#bib.bib42)]。然而,当由于隐私或存储问题导致训练数据不可用时,这可能不可行。为了克服这一限制,[39 (https://arxiv.org/html/2606.31420#bib.bib23)] 提出了测试时适应(TTA),它侧重于在测试阶段使用未标记的目标数据实时调整模型,而无需访问用于训练的源数据。 早期的TTA方法主要侧重于调整归一化统计量或熵最小化。例如,BN-1 [30 (https://arxiv.org/html/2606.31420#bib.bib34)] 通过将批归一化统计量与目标域对齐来调整模型,提供了一种简单而有效的方式来部分缓解分布偏移。TENT [39 (https://arxiv.org/html/2606.31420#bib.bib23)] 进一步通过最小化输入测试样本的预测熵同时更新批归一化统计量来更新模型参数。与这些部分更新策略相反,AdaContrast [2 (https://arxiv.org/html/2606.31420#bib.bib36)] 引入了一个结合对比学习的记忆模块,并在整个网络上执行适应,从而在测试时实现更丰富的表示学习。总体而言,这些方法表明模型可以仅使用未标记的测试数据有效适应分布偏移,突出了测试时学习作为提高模型鲁棒性的实用且灵活的解决方案的前景。 ### II-B 现实世界测试时适应 虽然现有的TTA方法在改善分布外泛化方面显示出强大的潜力,但它们大多是在相对受控的实验设置下开发和评估的,其中对测试环境的假设被简化,分布偏移的范围通常有限。因此,近期关于TTA的研究越来越侧重于将适应方法扩展到更现实的场景。在现实应用中已经确定了几个关键挑战,包括小批次或单样本更新的适应 [49 (https://arxiv.org/html/2606.31420#bib.bib9), 31 (https://arxiv.org/html/2606.31420#bib.bib4)]、类别不平衡的测试数据 [7 (https://arxiv.org/html/2606.31420#bib.bib18)]、持续变化的目标域 [40 (https://arxiv.org/html/2606.31420#bib.bib24), 23 (https://arxiv.org/html/2606.31420#bib.bib29), 28 (https://arxiv.org/html/2606.31420#bib.bib17)]、对噪声数据流的适应 [8 (https://arxiv.org/html/2606.31420#bib.bib6)]、多种分布偏移的混合 [27 (https://arxiv.org/html/2606.31420#bib.bib26)],以及有限计算资源或边缘设备部署造成的约束 [1 (https://arxiv.org/html/2606.31420#bib.bib27), 22 (https://arxiv.org/html/2606.31420#bib.bib28)]。经验证据表明,这些现实条件会显著降低现有TTA方法的性能。在这项工作中,我们通过引入一个结合类别原型引导的动态批次平衡组件来应对持续域偏移和严重类别不平衡的联合挑战。 ### II-C 原型学习 基于原型的方法通过一个紧凑且具有代表性的特征向量(称为原型)来表示每个类别,该原型通常计算属于该类别的嵌入样本的平均值。虽然类别原型的概念在模式识别中已有很长的历史,但原型网络 [33 (https://arxiv.org/html/2606.31420#bib.bib20)] 在现代深度学习中推广了其使用,特别是在少样本学习中,通过基于查询到类别原型的距离(而不是参数化分类器)进行分类。此后,基于原型的方法由于其鲁棒性和可解释性,已被广泛应用于各种场景,包括域适应 [17 (https://arxiv.org/html/2606.31420#bib.bib12), 34 (https://arxiv.org/html/2606.31420#bib.bib13)] 和语义分割 [29 (https://arxiv.org/html/2606.31420#bib.bib14), 36 (https://arxiv.org/html/2606.31420#bib.bib15)]。在TTA设置中,T3A [16 (https://arxiv.org/html/2606.31420#bib.bib21)] 利用类别原型在测试时调整分类器权重。相比之下,我们的方法利用原型信息来引导特征适应,而不是局限于分类器重校准,因此更适合处理更复杂且不断变化的测试时数据分布。 参见标题 Figure 2: 我们BP-TTA方法的总体框架。该方法通过引入BBS解决流式数据中的类别不平衡,并通过使用CPGA对齐跨域特征来缓解域偏移。在测试时适应过程中,我们优化一致性损失Lsup \mathcal{L}_{\text{sup}} 和原型损失Lproto \mathcal{L}_{\text{proto}} 的组合。 ## III 方法 ### III-A 问题定义 给定一个在标记源数据集 DSource={(xSource,ySource)} \mathcal{D}^{Source}=\{(\boldsymbol{x}^{Source},\boldsymbol{y}^{Source})\} 上预训练的模型 fθ f_\theta,以及随时间提供的一系列未标记目标域批次 DTarget={xTarget} \mathcal{D}^{Target}=\{\boldsymbol{x}^{Target}\}。在每个时间步 t t,目标样本来自随时间演变的分布 PtTarget(x) P_t^{Target}(\boldsymbol{x})。此外,由于时间依赖性,目标样本是非独立同分布的,并且潜在分布随时间持续演变。此设置受到现实世界动态场景的启发。
相似文章
用于叙述生成中分布外去偏差的预调节测试时适应
本文提出 CAP-TTA,一个测试时适应框架,利用由偏差风险分数触发的预调节 LoRA 更新,在叙述生成过程中缓解大语言模型的毒性和偏差问题,实现更快的优化和相比标准基线更好的流畅性。
测试时个性化:针对缩放失败的一种诊断框架与概率修正方法
本文提出了测试时个性化(TTP),这是一种通过候选采样和基于奖励的选择来扩展推理时计算,从而提升大语言模型(LLM)个性化能力的框架。该研究诊断了标准奖励模型中的失效模式,并提出了一种概率个性化奖励模型以缓解这些问题。
Stream-T1:用于流式视频生成的测试时扩展
Stream-T1 是一种针对流式视频生成提出的测试时扩展(TTS)框架,通过噪声传播和奖励剪枝等机制,提升了时间一致性和生成质量。该论文通过利用块级合成技术,解决了现有基于扩散模型的方法计算成本过高的问题。
物联网环境中机器学习即服务(MLaaS)的测试时自适应组合
提出了一种用于物联网环境中MLaaS的测试时自适应(TTA)组合框架,利用TTA感知的可组合性模型和服务级自适应在推理期间调整服务,相比传统自适应方法减少了计算时间。
TPA-AD:一种用于轴承时间序列异常检测的两阶段伪异常引导方法
TPA-AD 是一种用于轴承时间序列异常检测的两阶段伪异常引导方法,利用重建模型和对比学习在正常边界附近生成伪异常窗口,再通过 KNN 对异常进行评分——训练过程中无需真实异常样本。该方法在轴承故障和退化数据集上进行了评估,包括高速列车轴箱轴承数据。