面向持续测试时自适应的可靠性门控源锚定

arXiv cs.LG 论文

摘要

本文提出RMemSafe,一种用于持续测试时自适应的可靠性门控扩展方法,当冻结源的预测熵变高时会减弱源锚定,从而防止源崩溃下的盲目锚定。该方法在CCC基准测试上实现了最先进的错误率降低。

arXiv:2605.14063v1 公告类型:新 摘要:持续测试时自适应(CTTA)在线更新预训练模型于未标注、非平稳的数据流,同时将其锚定到冻结的源检查点。该锚定仅在源保持可靠时才有用。然而,在CCC-Hard上,ResNet-50源的top-1准确率下降至约$1.3\%$,而现有的源锚定CTTA方法继续使用相同的锚定强度。我们将这种失败模式称为盲目锚定,并提出了RMemSafe,一种基于ROID的可靠性门控扩展,它利用冻结源的归一化预测熵来减弱目标中所有显式的源耦合使用。当源后验接近均匀时,门关闭:源锚定和一致性过滤器消失,目标简化为与源无关的后备方案,包括ROID基础损失加边际校准。结合ASR,RMemSafe在9个匹配分割的持续损坏单元中的8个上实现了最低错误率,并且在所有9个单元上是最佳的重置方法,相较于ROID+ASR在ResNet-50上提升了$1.05$个百分点,在ViT-B/16上提升了$0.48$个百分点。控制源退化扫描显示,其危害斜率比ROID+ASR浅$1.13$倍,与优雅衰减预测一致。熵门检测的是高熵源崩溃,而不是置信度错误的低熵源;该范围已被明确评估和讨论。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:26

# 面向持续测试时自适应的可靠性门控源锚定 来源:https://arxiv.org/html/2605.14063 Vikash Singh¹,Debargha Ganguly¹,Weicong Chen¹,Sabyasachi Sahoo²,³, Sreehari Sankar¹,Biyao Zhang¹,Mohsen Hariri¹,Shouren Wang¹, Osama Zafar¹,Christian Gagné²,³,Vipin Chaudhary¹ ¹凯斯西储大学,²拉瓦尔大学,³Mila-魁北克人工智能研究所 [email protected]

###### 摘要

持续测试时自适应(CTTA)在无标签、非平稳的数据流上在线更新预训练模型,同时将其锚定于一个冻结的源检查点。只有当源模型保持可靠时,该锚定才有效。然而,在CCC-Hard上,一个ResNet-50源模型的top-1准确率降至约1.3%,而现有的源锚定CTTA方法仍继续使用相同的锚定强度。我们将这种失败模式称为*盲目锚定*,并提出RMemSafe,这是一种面向ROID的可靠性门控扩展,它利用冻结源模型的归一化预测熵来减弱目标中所有显式的源耦合用法。当源后验接近均匀分布时,门控关闭:源锚定和一致性滤波器消失,目标函数简化为一个源无关的后备方案,包括ROID的基础损失加上边际校准。结合ASR后,RMemSafe在9个匹配分割的持续损坏单元中的8个上实现了最低错误率,并且是所有9个单元中基于重置的最佳方法,在ResNet-50上比ROID+ASR提升了1.05个百分点,在ViT-B/16上提升了0.48个百分点。一个受控的源退化扫描显示,其损害斜率比ROID+ASR浅1.13倍,与优雅降级预测一致。熵门控检测高熵源崩溃,而非自信错误的低熵源;此范围被明确评估和讨论。

## 1 引言

部署在变化、无标签数据流上的模型面临一个基本的安全问题:能否防止自适应过程将模型驱动到比初始状态更差的状态?持续测试时自适应(CTTA)通过在在线更新预训练模型的同时将其锚定于冻结的源模型[32,19,20,16,14,21]来解决此问题,锚定防止了在噪声伪标签下发生失控漂移。锚定带有一个静默的、运行时未检查的前提条件:源模型在整个自适应过程中保持有意义的参考。在CCC基准[22,14]的最困难级别上,ResNet-50源模型的top-1准确率约为1%,然而我们评估的每一个先前CTTA方法都继续以无条件固定强度的L2惩罚将自适应模型拉向这个退化的参考。这种盲目锚定是当前CTTA方法的一个系统性失败模式,可以用一个轻量级的运行时检查来代替对源的固定强度信任,从而恢复分析性的优雅降级属性。

![图1](https://arxiv.org/html/2605.14063)

图1:源可靠性崩溃下的持续测试时自适应。CTTA将适配器锚定于其冻结的源模型,假设源模型保持有意义的参考。蓝色:在CCC上,冻结的RN-50源模型top-1从76%(干净ImageNet)崩溃到1.3%(CCC-Hard)。红色虚线:先前基于重置的方法(ROID/ETA/EATA+ASR, ROID+RDumb)在所有严重程度上保持λ=2,将适配器拉向接近噪声的输出。绿色:RMemSafe将λ乘以源模型自身后验熵的运行时可靠性R_src=max(0,1-H_src)。在CCC-Hard上测量的λ_eff=0.53(基于3,128个批次的轨迹,附录图6);其他值遵循单调的熵-准确率关系。在灾难性区域(阴影),RMemSafe将锚定减弱3.8倍;这种减弱是在受控退化下证明的分析性安全属性(§4,附录M)。标准CCC上的匹配分割增益反映了整合的目标函数;门控的安全作用在受控源退化轴上被隔离出来(附录I)。

RMemSafe实例化了这一检查。它门控了ROID[16]优化中所有显式的源耦合用法:朝向θ*_src的L2锚定、基于余弦的源专家一致性滤波器,以及锚定内部的源散度因子。所有这三个都通过一个单一的源可靠性标量R_src=max(0,1-H_src)进行乘法调制,该标量源自源熵。由于仅靠门控是不够的(当门控关闭时剩余损失本身不能崩溃),门控与三个从标准实践中改编的辅助稳定器相结合:边际校准、置信度缩放的learning rate,以及在推理时的解耦置信度插值翻转。由此产生的方法具有分析性的优雅降级属性(命题1):当源熵饱和时,源相关项消失,总目标简化为基础CTTA损失加上边际校准项,与冻结的源参数无关。在CCC-Hard上,与先前固定λ=2的方法相比,门控将运行时锚定减弱了3.8倍。这种减弱是该方法的分析性安全属性;其经验特征是在受控源退化下具有较浅的损害斜率,而匹配分割基准的改进反映了整合目标函数的联合运行。

两个评估轴证实了该属性。在跨越九种持续损坏基准单元(两种架构、三个CCC难度级别、两种CIN-C排序以及IN-C 20次重访)的匹配分割评估中,RMemSafe在9个单元中的8个上实现了最低错误率,与最强匹配分割先前基线ROID+ASR相比,在ResNet-50上平均CCC错误率降低了1.05个百分点,在ViT-B/16上降低了0.48个百分点(配对t检验,合并p<10^-16,95% CI [-1.16, -0.94],Cohen's dz=-3.65;附录E,表7)。在通过高斯权重噪声将干净测试源准确率从S=0.75降至S=0.12的受控源退化实验中,RMemSafe在每个测试严重程度上都比ROID+ASR更优雅地退化,损害斜率为每单位S 11.43个百分点,而ROID+ASR为12.92个百分点,比例为1.13倍,方向与命题1预测一致。

一个明确的范围被事先说明。可靠性门控仅使用源*熵*作为其唯一的可靠性信号。这解决了实践中观察到的主要CTTA失败模式——由CCC-Hard示例的高熵源崩溃,但不适用于*自信的误校准*源:一个错误但不不确定的源会被R_src视为可靠。设计一个正确性感知的可靠性信号是未来的工作方向(§5)。我们在此标记此范围,以便方法声明被狭义地理解。我们通过实验确认这一点:在置换类别的低熵错误源下,RMemSafe按预期失去优势,而在高熵状态下则保持优势(表16)。RMemSafe是*针对熵可检测的源故障*的优雅降级。

本文通过以下关键贡献推进了优雅降级的CTTA:
- • **盲目锚定的诊断。** 在CCC-Hard上,先前方法以全强度锚定于top-1准确率约为1%的源:我们命名并表征了这一系统性的CTTA失败模式(图1)。
- • **具有优雅降级保证的可靠性门控CTTA。** 据我们所知,RMemSafe是第一个通过从冻结源导出的运行时可靠性信号门控所有显式源耦合用法,并具有分析性优雅降级属性(命题1)的CTTA方法;整合的目标函数使后备状态定义良好。
- • **在真实和受控退化下的经验确认。** 在匹配分割基准上取得8/9胜(每单元配对t检验,CI,dz见附录E);在受控源质量扫描下,损害斜率比ROID+ASR更浅,在明确压力测试的范围内(附录P)。
- • **重置范式失败模式的诊断。** 在ViT-B/16上的CCC-Hard中,每个基于重置的方法都逊于非重置的ROID,首次在匹配分割粒度上被表征(§4.3);可靠性门控的τ扫描部分缩小了差距(附录O)。

## 2 相关工作

**测试时自适应。** TTA[28]通过测试时批量归一化重新校准[24]、熵最小化[30]、Fisher正则化更新[19]、自监督辅助更新[15]、基于原型的分类器调整[10]和每实例测试时增强[36]从无标签流中适配预训练模型;非饱和替代物,如通过ROID继承的软似然比[18],在熵饱和处替换熵。DeYO[11]显示基于熵的选择在解耦伪因素下失败,COME[37]通过Dirichlet先验保守熵解决熵的过度自信病理。我们将熵用作冻结源可靠性的代理,而非自适应专家的自训练目标;这改变了失败模式,但并未消除低熵误校准,我们在§5和附录P中对此进行了评估。独立的TTA在连续、非平稳的漂移下仍然遭受灾难性遗忘和误差积累[13]。

**持续测试时自适应。** CTTA通过随机恢复[32]、样本过滤[20]、时间相关下的实例感知归一化[7,35]、对称交叉熵均值教师训练[2](其SymCE项我们继承到源无关后备中)、动量集成[16]、卡尔曼滤波[12]、内存高效自蒸馏正则化[27]、自适应崩溃感知[9]以及鲁棒伪标记自训练[23,29]来稳定持续自适应。这条线上的一个关键限制是隐含假设静态源保持可靠锚定,当严重损坏灾难性地混淆源时,这种假设失败。RMemSafe通过基于局部源可靠性动态门控源一致性和锚定强度,并具有源崩溃下分析推导的优雅降级属性,来解决这种“盲目锚定”缺陷。

**长期自适应与重置。** 长期严重偏移(例如CCC-Hard[22,17])导致CTTA模型崩溃,激发了重置范式:周期性参数恢复(RDumb[22])或自适应重置(ASR[14])。重置可以阻止崩溃,但可能擦除已获取的目标知识,并且向灾难性混淆的源重置本身可能有害(§4.3)。RMemSafe是互补的:它在积累之前减弱不可靠的源引导更新,提高自适应阶段稳定性,并有效地与ASR结合。CCC和ImageNet-C基准[22,8]提供了我们评估中使用的损坏流。

## 3 方法:可靠性门控测试时自适应

当源后验为均匀分布时,每个源相关项都应乘法式消失,从而将源从梯度中移除(命题1);我们现在构建门控和稳定器,使此后备保持良好行为。

![图2](https://arxiv.org/html/2605.14063)

图2:RMemSafe概述。可靠性引擎从冻结源模型的熵导出源可靠性门控R_src=1-H_src。R_src门控所有显式源耦合用法:动态锚定、一致性滤波器(在源一致性和直通之间插值),以及锚定内部的源散度缩放,同时保持基础ROID损失和边际校准不被门控。在推理时,置信度插值翻转平均产生最终预测。当源崩溃时,R_src→0,总损失简化为非崩溃的源无关后备状态(命题1)。

令f_{θ*_src}表示一个预训练的源模型,具有在源分布D_S上训练的冻结参数θ*_src。在持续测试时自适应期间,模型观察来自偏移、非平稳目标分布D_T的无标签流x_t∈X_T,并持续更新专家参数θ_exp(初始化为θ_exp←θ*_src)以最小化流上的经验风险。我们基于ROID框架[16],该框架优化 soft-likelihood-ratio loss L_slr 和 consistency loss L_con

相似文章

CRMA: 一种用于LLM模块化持续微调的谱界主干

arXiv cs.LG

CRMA引入了一种谱界残差适配器,通过Sinkhorn归一化强制实现双随机混合矩阵,使LLM能够持续微调而不发生灾难性遗忘。在Mistral-7B和Gemma-2-9B上的实验结果表明,与冻结基底的基线相比,后向迁移得到改善,遗忘减少。

MEMOREPAIR:智能体记忆中的屏障优先级联修复

arXiv cs.AI

本文介绍了 MemoRepair,这是一种针对智能体记忆的屏障优先级联修复协议,旨在解决源数据变更时衍生工件过时的问题。实验表明,与穷举修复方法相比,MemoRepair 显著降低了失效记忆的暴露率和修复成本。

MARCH:利用内容路由状态锚点扩展循环记忆

arXiv cs.LG

本文介绍了MARCH,一种网络架构,通过将累积的循环状态检查点缓存为内容可寻址的状态锚点,将循环状态空间模型扩展到固定尺寸维度之外,从而实现高效的长程记忆检索,在长上下文基准测试中优于线性注意力变体。