面向开放世界测试时适应的可靠神经坍缩近似方法

arXiv cs.LG 论文

摘要

本文提出了一种名为ReNC的开放世界测试时适应方法,该方法利用神经坍缩作为结构先验来过滤分布外样本并优化原型,以实现可靠的模型适应。

arXiv:2608.19890v1 公告类型:新 摘要:测试时适应(TTA)方法旨在弥合源域和目标域之间的域差距。然而,当标签分布偏移发生时,传统的TTA方法变得无效,这一挑战通常被称为开放世界场景。本文提出了一种名为可靠神经坍缩近似(ReNC)的新方法,用于开放世界测试时适应(OWTTA)。具体而言,我们利用神经坍缩作为结构先验,以实现可靠的目标域适应。在该先验的指导下,我们证明预训练的分类器权重可以作为源域的原型。通过测量样本与原型之间的相似度,我们过滤分布外(OOD)样本以进行可靠更新。此外,我们提出了一种神经坍缩近似机制来优化这些原型,确保它们能够在保持神经坍缩结构的同时逐渐适应目标域。在多个开放世界基准上的大量实验证明了所提方法的优越性。我们的经验分析表明,ReNC在目标域中更好地保留了神经坍缩相关特性,为解释可靠的OWTTA提供了有用证据,并为模型设计提供了新的见解。代码可在https://github.com/JiaqiLin-AI/ReNC获取。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:30

# 面向开放世界测试时适应的可靠神经坍缩近似
来源:https://arxiv.org/html/2608.19890  
作者:Yuangang Pan, Chang-Dong Wang, Haizhang Zhang  
单位:Ivor W. Tsang, and Joey Tianyi Zhou  

###### 摘要  
测试时适应方法旨在弥合源域与目标域之间的域偏移。然而,当出现标签分布偏移时,传统TTA方法会失效,这种情况通常被称为开放世界场景。本文提出一种名为可靠神经坍缩近似的新方法,用于开放世界测试时适应。具体而言,我们利用神经坍缩作为可靠目标域适应的结构先验。在此先验指导下,我们证明预训练分类器权重可作为源域的原型。通过测量样本与原型之间的相似度,我们能够过滤分布外样本以实现可靠更新。此外,我们提出神经坍缩近似机制来精炼这些原型,确保其能在保持神经坍缩结构的同时逐步适应目标域。在多个开放世界基准测试上的大量实验证明了所提方法的优越性。我们的经验分析表明,ReNC在目标域中更好地保留了神经坍缩相关特性,为解释可靠的开放世界测试时适应提供了有用证据,并为模型设计提供了新的见解。代码可在https://github.com/JiaqiLin-AI/ReNC获取。

## 1 引言  
测试时适应因其能够在无需访问整个数据批次的情况下提升深度学习模型的泛化能力而受到广泛关注。其旨在数据分布偏移条件下(即训练数据和测试数据来自不同域),弥合训练数据与测试数据之间的分布差距。现有TTA方法通过将目标特征与源分布对齐或最小化模型输出熵来解决域适应问题。这两种方法在增强数据分布偏移下的模型性能方面均表现出显著效果。

TTA的一个基本假设是训练样本和测试样本共享相同的标签空间。然而,在更现实的开放世界场景中,这一假设可能被违反。在开放世界场景下,测试数据不仅包含已见类别(即分布内数据),还可能包含未见类别(即分布外数据)。这种标签分布偏移会使现有TTA方法失效。例如,在医学影像中,由于采集设备差异和模型训练时未遇到的新疾病,数据分布偏移和标签分布偏移经常同时发生。模型需要适应同时发生的数据分布偏移和标签分布偏移,这被称为开放世界测试时适应,对学术界仍是一个挑战。OWTTA主要面临两大挑战:1)由OOD样本引起的标签分布偏移使模型更新过程不可靠;2)数据分布偏移引入的域差距进一步增加了有效适应的难度。

近期有少量研究将OWTTA作为增强深度神经网络泛化能力的有效策略进行探索。这些研究通常采用两步流程来应对上述挑战:首先从目标数据中过滤OOD样本以缓解标签分布偏移的负面影响,这通常通过测量特征与其最近原型的相似度来区分ID和OOD样本;其次对剩余的ID样本应用TTA以解决数据分布偏移造成的分布差距。然而,这些方法使用固定原型优化模型,这些原型通常来自源域或预训练分类器。实践中,由于计算限制、隐私顾虑或版权限制,源原型往往不可用。此外,即使可用,来自源域的原型也常因数据分布偏移而无法与目标域很好对齐。

在本文中,我们引入一种新的OWTTA方法——可靠神经坍缩近似,通过近似目标域中的神经坍缩结构来解决上述挑战。神经坍缩描述了训练良好的分类神经网络的终端几何结构,其中特征呈现类内紧凑、类均值与分类器权重对齐,且分类行为类似最近类中心预测。基于此特性,我们利用神经坍缩作为可靠的结构先验来指导OWTTA。然而,神经坍缩通常仅在有标签的源数据上出现,无法直接在无标签的目标数据上实现。因此,我们提出ReNC方法以可靠近似目标域的神经坍缩状态。

如图1b所示,ReNC不仅将目标特征推向其对应原型,还更新原型以近似目标域神经坍缩状态。具体而言,考虑到预训练源模型已经坍缩,我们引入无参机制过滤OOD样本以确保可靠更新。该机制评估目标域特征与原型的相似度,确保适应过程聚焦于ID样本。此外,我们将神经坍缩近似表述为渐进适应过程,鼓励可靠目标特征接近其对应原型,同时通过先验正则化适应更新原型以保持潜在的神经坍缩几何结构。得益于可靠高效的更新,ReNC无需访问整个目标数据批次即可在目标域实现更好的神经坍缩状态。我们总结贡献如下:
- 我们首次将神经坍缩概念引入OWTTA,并从神经坍缩角度证明分类器权重等同于源域原型。
- 我们提出新的OWTTA框架ReNC,其特色是通过高效更新机制近似目标域神经坍缩状态,为TTA提供可靠的结构先验。
- 在多个开放世界基准测试上的大量实验证明了ReNC在OWTTA中的有效性,进一步分析表明ReNC在目标适应过程中更好地保留了神经坍缩相关表示特性。

本文其余部分组织如下:第2节定义OWTTA问题并简要回顾相关文献;第3节从基本概念到最终方法逐步介绍我们的ReNC方法;第4节基于大量实验对ReNC方法进行深入评估以验证其有效性;最后第5节总结主要发现并结束本文。

## 2 问题定义与文献综述  
本节首先介绍闭世界测试时适应的设定,然后将问题扩展至数据包含标签分布偏移的开放世界场景。最后,将该设定与分布外检测和通用域适应进行比较,讨论它们与OWTTA的区别。

### 2.1 测试时适应  
**数据分布偏移**:我们考虑分类任务,其中$\mathcal{X}$和$\mathcal{Y}$分别表示数据空间和标签空间。在$\mathcal{X} \times \mathcal{Y}$上存在两个不同的分布,称为源域$\mathcal{D}_S$和目标域$\mathcal{D}_T$。数据分布偏移的发生是因为源数据集$\mathcal{S}_S$和目标数据集$\mathcal{S}_T$分别独立采样自两个不同的域$\mathcal{D}_S$和$\mathcal{D}_T$,导致其分布存在差异:
$$\mathcal{S}_S = \left\{ \left( \mathbf{x}_i, y_i \right) | \mathbf{x}_i \in \mathcal{D}_S \right\}, \quad \mathcal{S}_T = \left\{ \mathbf{x}_i | \mathbf{x}_i \in \mathcal{D}_T \right\}.$$

各种域适应方法已被提出以消除$\mathcal{D}_S$和$\mathcal{D}_T$之间的域差距。其中,测试时适应因其假设模型无法访问源数据和目标标签,更适合实际应用而备受关注。许多TTA方法受自训练启发,采用各种技术适应无标签目标数据。测试时熵最小化提出仅更新批归一化层参数以最小化logit熵。源假设传输冻结源模型分类器并更新特征提取模块,在保持目标域平衡分布的同时最小化熵。此外,分布对齐技术也用于TTA,将源域分布作为锚点对齐目标域特征。测试时训练方法修改预训练过程以在适应时获取源域统计信息而不访问源数据。然而,由于交替预训练过程,该方案仍不实用。

为解决此问题,有研究通过保存源域分布并将高置信度目标特征对齐至该分布进行更新(无需改变预训练)来改进TTA性能。此外,自监督学习技术也广泛应用于TTA,因为它们无需考虑目标数据的语义信息。例如,对比学习被引入以精炼在线伪标签过程,利用自监督技术增强目标特征适应。自监督训练分支被引入在适应期间微调特征编码器参数。尽管大多数测试时适应方法在静态目标分布假设下开发并主要关注视觉数据,但近期工作开始探索更复杂和现实的设定。一些研究考虑目标域分布随时间连续变化的情景,有研究进一步将其扩展到现有类别比例动态变化、可能导致类别不平衡的演化环境。同时,有研究探索表格数据的上下文测试时适应,并提出一种方法利用置信预测估计测试时标签分布并相应校准模型输出。此外,视觉语言模型也通过提示调优探索测试时适应,其中无需标签优化提示以在推理时提高准确性和校准度。

### 2.2 开放世界测试时适应  
**标签分布偏移**:现有TTA方法在假设源域和目标域具有相同标签空间的前提下取得了显著改进。然而,在开放世界场景中,这一假设可能被违反,分布偏移同时存在于数据空间$\mathcal{X}$和标签空间$\mathcal{Y}$中。

相似文章

面向持续测试时自适应的可靠性门控源锚定

arXiv cs.LG

本文提出RMemSafe,一种用于持续测试时自适应的可靠性门控扩展方法,当冻结源的预测熵变高时会减弱源锚定,从而防止源崩溃下的盲目锚定。该方法在CCC基准测试上实现了最先进的错误率降低。

大语言模型顺序后训练中的表征坍塌

arXiv cs.LG

本文研究了大型语言模型在顺序后训练中的表征坍塌现象,表明重复的适应阶段会压缩内部表征,降低可塑性和域外泛化能力。作者提出了轻量级干预措施,在不牺牲行为增益的前提下保留未来的可学习性。

测试对未知对手的鲁棒性

OpenAI Blog

# 测试对未知对手的鲁棒性 来源:[https://openai.com/index/testing-robustness/](https://openai.com/index/testing-robustness/) OpenAI 我们开发了一种方法来评估神经网络分类器是否能可靠地抵御训练期间未见过的对抗性攻击。我们的方法产生了一个新的指标 UAR(未知攻击鲁棒性),它评估单个模型对意外攻击的鲁棒性,并强调了需要在更多样化的未知攻击范围内测量性能