ComMem: 用于视觉语言模型测试时自适应的互补记忆系统

arXiv cs.AI 论文

摘要

ComMem 提出了受生物记忆启发的互补记忆系统,以改进视觉语言模型的测试时自适应,在15个基准测试上超越了现有最先进方法。

arXiv:2606.28719v1 公告类型:新 摘要:视觉语言模型(VLM)的测试时自适应(TTA)对于其在动态真实世界环境中的稳健部署至关重要。然而,现有的TTA方法通常进行局部自适应,而不随时间累积知识,或仅在单一模态内操作,未能利用VLM固有的多模态特性。受生物大脑中\textbf{Com}plementary \textbf{Mem}ory(互补记忆)系统的启发,我们提出了\textbf{ComMem},这是一种创新方法,模仿海马体和新皮层的不同但协作的角色,以实现VLM的有效TTA。ComMem包含两个关键组件:一个快速适应的详细记忆(类似于海马体),从高置信度的测试样本中形成动态视觉缓存;以及一个慢速整合的抽象记忆(类似于新皮层),不断优化全局文本原型。对于每个测试实例,ComMem联合优化两个记忆系统以确保跨模态一致性。在15个基准数据集上的大量实验表明,ComMem在自然分布偏移和跨数据集泛化下均显著优于最先进的方法,为增强VLM的实际适应性提供了一个有前景的方向。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:31

# ComMem:视觉语言模型测试时适应的互补记忆系统
来源:https://arxiv.org/html/2606.28719

翟子涵¹ & 闫宏伟¹ & 苏航⁵ & 朱军⁵,∗ & 钟毅¹,∗ & 
¹清华大学生命科学学院/IDG麦戈文脑科学研究院,北京,中国
²中国科学院软件研究所,北京,中国
³北京人工智能研究院,北京,中国
⁴清华大学心理学与认知科学系,北京,中国
⁵清华大学计算机科学与技术系/人工智能研究院/清华-博世联合机器学习中心/清华脑与智能实验室/北京信息科学技术国家研究中心,北京,中国
⁶同等贡献
∗通讯作者:[email protected], [email protected]

###### 摘要

视觉语言模型(VLM)的测试时适应(TTA)对于其在动态真实环境中的稳健部署至关重要。然而,现有的TTA方法往往在局部层面上进行适应,无法随时间积累知识,或者仅在单一模态内运行,未能充分利用VLM固有的多模态特性。受生物大脑中互补记忆系统的启发,我们提出了ComMem,一种创新的方法,它模仿海马体和新皮层各自独特但协同的角色,以实现VLM的有效TTA。ComMem包含两个关键组件:一个快速适应的细节记忆,类似于海马体,从高置信度测试样本中形成动态视觉缓存;以及一个慢速整合的抽象记忆,类似于新皮层,持续优化全局文本原型。对于每个测试实例,ComMem联合优化两个记忆系统以确保跨模态一致性。在15个基准数据集上的广泛实验表明,ComMem在自然分布偏移和跨数据集泛化场景下均显著优于最先进的方法,为增强VLM的实际适应性提供了一个有前景的方向。

## 1 引言

开创性的视觉语言模型(VLM),如CLIP(Radford等人,2021 (https://arxiv.org/html/2606.28719#bib.bib35)),通过从海量图像-文本语料库中学习,实现了强大的零样本泛化能力,从而变革了计算机视觉领域。尽管这些模型能力令人印象深刻,但在部署到真实环境时,测试时数据分布与预训练数据分布存在偏差,往往会导致性能显著下降(Agarwal等人,2021 (https://arxiv.org/html/2606.28719#bib.bib2);Menon等人,2024 (https://arxiv.org/html/2606.28719#bib.bib29))。为应对这一挑战,测试时适应(TTA)作为一种强大的范式应运而生,它允许预训练模型仅使用无标签的测试样本流来适应不同的目标域(Liang等人,2025 (https://arxiv.org/html/2606.28719#bib.bib23);Dong等人,2025 (https://arxiv.org/html/2606.28719#bib.bib8))。

近期VLM的TTA研究已从无记忆的方案(即针对每个样本或小批量独立优化模型)发展到更先进的基于记忆的方法¹¹¹由于篇幅限制,我们在附录A (https://arxiv.org/html/2606.28719#A1)中提供了更全面的相关工作总结。。早期方法,以TPT(Shu等人,2022 (https://arxiv.org/html/2606.28719#bib.bib38))及其变体如DiffTPT(Feng等人,2023 (https://arxiv.org/html/2606.28719#bib.bib11))和SwapPrompt(Ma等人,2023 (https://arxiv.org/html/2606.28719#bib.bib25))为代表,以“失忆”的方式运行,即孤立地适应每个测试实例,而不随时间保留经验(图1 (https://arxiv.org/html/2606.28719#S1.F1)A)。认识到这一局限性,后续研究引入了记忆机制,这些机制大致可根据其适应组件进行分类:有些通过提示调优在文本层面积累知识,如HisTPT(Zhang等人,2024b (https://arxiv.org/html/2606.28719#bib.bib48))和DynaPrompt(Xiao等人,2025 (https://arxiv.org/html/2606.28719#bib.bib45))(图1 (https://arxiv.org/html/2606.28719#S1.F1)B),而另一些则在视觉表示层面维护动态缓存,如TDA(Karmanov等人,2024 (https://arxiv.org/html/2606.28719#bib.bib20))和DMN-ZS(Zhang等人,2024c (https://arxiv.org/html/2606.28719#bib.bib50))(图1 (https://arxiv.org/html/2606.28719#S1.F1)C)。然而,将适应限制在单一模态会限制模型有效对齐视觉和文本表示的能力。没有协调的跨模态更新,这些方法无法平衡互补的快速(可塑性)和慢速(稳定性)学习动态,从而限制了快速适应新领域特定线索的能力,同时又在分布偏移下保持了预训练知识的鲁棒性(图1 (https://arxiv.org/html/2606.28719#S1.F1)D-E)。

图1:ComMem与近期TTA方法的比较。Norm.,归一化;Con.,巩固;Recon.,再巩固。

图2:神经科学中互补记忆系统理论概览(McClelland等人,1995 (https://arxiv.org/html/2606.28719#bib.bib28);Tonegawa等人,2018 (https://arxiv.org/html/2606.28719#bib.bib41);Lei等人,2025 (https://arxiv.org/html/2606.28719#bib.bib22))。

在神经科学中,*互补记忆系统*理论(McClelland等人,1995 (https://arxiv.org/html/2606.28719#bib.bib28);Tonegawa等人,2018 (https://arxiv.org/html/2606.28719#bib.bib41);Lei等人,2025 (https://arxiv.org/html/2606.28719#bib.bib22)),也称为*互补学习系统*,已被广泛认可用于实现新经验与先验知识的整合,从而获得最优行为输出。该理论假设两个不同记忆系统之间存在功能协同(图2 (https://arxiv.org/html/2606.28719#S1.F2)A):海马体(HPC)快速编码情景和细节记忆;新皮层(NC)缓慢形成语义和可泛化的知识。随着时间的推移,记忆痕迹通过*系统巩固*(图2 (https://arxiv.org/html/2606.28719#S1.F2)B)(Golbabaei & Frankland,2025 (https://arxiv.org/html/2606.28719#bib.bib12))过程逐渐从HPC转移到NC。更重要的是,最近一项工作揭示,回忆依赖NC的记忆可以诱导HPC中的*记忆再巩固*阶段(图2 (https://arxiv.org/html/2606.28719#S1.F2)C),允许HPC整合新信息并重建记忆痕迹(Lei等人,2025 (https://arxiv.org/html/2606.28719#bib.bib22))。

受这种成熟的生物机制启发,我们引入了ComMem,一种创新的TTA方法,它实例化了互补记忆系统的动态过程,用于VLM的鲁棒适应(图3 (https://arxiv.org/html/2606.28719#S2.F3),伪代码见附录算法1 (https://arxiv.org/html/2606.28719#alg1))。ComMem将HPC的快速度、高可塑性学习建模为一个细节记忆缓存,该缓存快速存储和更新来自高置信度测试样本的视觉特征。同时,它将NC的慢速度、高稳定性学习建模为由全局文本原型组成的抽象记忆,这些原型通过类似于记忆巩固的过程逐步演化。对于每个传入的测试样本,ComMem通过从两个记忆系统检索并借助可学习残差联合优化它们来模拟记忆再巩固,从而强制执行跨模态一致性。这使得模型不仅能够适应单个样本,还能在测试数据流中逐步积累和完善领域知识。

我们在15个具有挑战性的基准数据集上进行了广泛实验来评估ComMem。结果表明,ComMem在自然分布偏移(如ImageNet-A/R/S)的鲁棒性和广泛的跨数据集泛化场景中,均持续显著优于当前最先进的方法。ComMem在使用ResNet-50(He等人,2016 (https://arxiv.org/html/2606.28719#bib.bib14))时在ImageNet-OOD变体上达到了48.84%的新平均准确率,在使用ViT-B/16(Dosovitskiy等人,2020 (https://arxiv.org/html/2606.28719#bib.bib9))时达到65.36%。此外,我们的方法在确保强大性能的同时,其计算开销也远低于像TPT(Shu等人,2022 (https://arxiv.org/html/2606.28719#bib.bib38))这样的著名提示调优方法。详细的消融研究证实,快速适应的细节记忆与慢速整合的抽象记忆的协同组合,以及我们的再巩固过程,是其成功的关键。我们的主要贡献如下:

* •我们提出了ComMem,一种受大脑启发的VLM TTA方法,首次将大脑互补记忆系统背后独特的快、慢学习动态过程付诸实践。
* •我们设计了一种协同机制,包括快速更新的细节缓存和慢速巩固的抽象记忆,通过再巩固过程联合优化以实现跨模态一致性。
* •我们在15个基准数据集上进行了广泛实验,证明ComMem在分布偏移和跨数据集泛化场景下显著优于最先进的TTA方法。

## 2 预备知识

在本节中,我们描述零样本VLM分类的问题形式化、VLM中的测试时适应,以及我们受大脑启发的动机。

### 2.1 形式化

#### 零样本VLM分类

代表性的VLM如CLIP(Radford等人,2021 (https://arxiv.org/html/2606.28719#bib.bib35))由一个视觉编码器\(E_v(\cdot)\)和一个文本编码器\(E_t(\cdot)\)组成,它们将图像和文本投影到一个共享的高维嵌入空间\(\mathbb{R}^D\)。对于一个\(C\)路分类任务,类别名称\(\{y_c\}_{c=1}^C\)通过提示集成(例如,“a photo of a {CLASS}”)嵌入为文本特征,得到文本原型矩阵\(P^t \in \mathbb{R}^{D \times C}\)。对于输入图像\(\mathbf{x}\),其视觉特征\(\mathbf{f}_v = E_v(\mathbf{x})\)与文本特征通过余弦相似度进行比较,产生零样本类别后验概率:
\[
p(y=c|\mathbf{x}) = \frac{\exp(\text{sim}(\mathbf{f}_v, \mathbf{p}_c^t)/\tau)}{\sum_{j=1}^C \exp(\text{sim}(\mathbf{f}_v, \mathbf{p}_j^t)/\tau)},
\tag{1}
\]
其中\(\mathbf{p}_c^t\)是第\(c\)个文本原型,\(\text{sim}(\cdot,\cdot)\)表示余弦相似度,\(\tau\)是温度超参数。

#### VLM中的测试时适应

我们考虑一个*在线流式*测试时适应(TTA)场景,其中预训练的VLM \((E_v, E_t)\)被部署在目标域中,无标签的测试样本\(\{\mathbf{x}_s\}_{s=1}^S\)顺序到达。没有真实标签可用,目标分布\(P_{\text{tgt}}(x)\)与源分布\(P_{\text{src}}(x)\)不同。目标是在线适应模型以最小化期望的目标误差:
\[
\min_{\theta} \mathbb{E}_{\mathbf{x} \sim P_{\text{tgt}}}[\ell(\hat{y}(\mathbf{x};\theta), y)],
\tag{2}
\]
其中\(\theta\)表示模型及其辅助适应模块的参数,\(\ell(\cdot)\)是分类损失,\(\hat{y}\)表示模型的预测。与常规域适应不同,TTA无法访问带标签的目标数据。在*在线流式*设置中,测试样本以连续流的形式顺序到达。因此,适应算法必须满足以下动态过程:
\[
\mathbf{x}_s \sim P_{\text{tgt}}, \tag{3}
\]
\[
\theta_s = \text{Update}(\theta_{s-1}, \mathbf{x}_s), \tag{4}
\]
\[
\hat{y}_s = f(\mathbf{x}_s; \theta_s), \tag{5}
\]
其中\(s\)为时间步索引,\(\text{Update}(\cdot)\)表示基于模型置信度、熵或一致性的无监督适应规则。一个核心挑战在于*快速适应*领域特定变化以减轻自训练噪声导致的误差累积,同时*保持稳定性*以防止灾难性遗忘。为解决这一权衡,我们从稳健的生物大脑中汲取灵感,特别是*互补记忆系统*理论。

### 2.2 受大脑启发的动机

图3:提出的ComMem框架,用于视觉语言模型的测试时适应。

生物大脑卓越的适应性源于以下两个记忆系统之间的相互作用(图2 (https://arxiv.org/html/2606.28719#S1.F2)A)(McClelland等人,1995 (https://arxiv.org/html/2606.28719#bib.bib28);Tonegawa等人,2018 (https://arxiv.org/html/2606.28719#bib.bib41);Lei等人,2025 (https://arxiv.org/html/2606.28719#bib.bib22)):

* •**新皮层(NC)**:新皮层通过*慢速、整合式学习*编码语义、抽象知识(如“狗”的概念),确保知识的稳定性和跨经验的泛化能力。
* •**海马体(HPC)**:海马体快速捕获具体的、情景化的经验(如“我在公园里看到的那只特定的狗”),支持*快速、基于实例的学习*,具有高可塑性。

两个记忆系统之间相互作用的关键机制是*系统巩固*和*系统再巩固*。在*系统巩固*(图2 (https://arxiv.org/html/2606.28719#S1.F2)B)过程中,编码在海马体中的情景痕迹逐渐整合到新皮层中的皮层表征中,从而实现长期可泛化知识的抽象化。相反,在*系统再巩固*(图2 (https://arxiv.org/html/2606.28719#S1.F2)C)过程中,当遇到新刺激时,新皮层检索现有的抽象表征记忆来解释来自海马体的新情景输入。随后,两个记忆痕迹被联合更新,使得大脑能够随时间维持连贯且适应性强的表征。

受这种快、慢学习系统之间有效协同的启发,我们提出的ComMem框架(图3 (https://arxiv.org/html/2606.28719#S2.F3))在计算上将这些动态过程实例化,用于VLM的TTA。具体来说,我们将一个*细节记忆缓存*(类似于HPC)建模为快速存储和更新来自测试数据流的高置信度视觉特征,以实现快速适应;将一个*抽象记忆系统*(类似于NC)表示为缓慢演化的文本原型,积累稳定、可泛化的知识。对于每个传入的测试样本,ComMem执行记忆巩固和记忆再巩固的计算类比,其中来自两个记忆的信息被检索并联合优化以确保跨模态对齐,然后将可靠的更新逐步巩固到抽象记忆中。

## 3 方法

ComMem框架如图3 (https://arxiv.org/html/2606.28719#S2.F3)所示(伪代码见附录算法1 (https://arxiv.org/html/2606.28719#alg1))。我们首先介绍两个互补的记忆组件及其独特的更新机制,然后详细阐述计算上模拟互补记忆系统的联合优化过程。

相似文章

AdMem:面向任务求解智能体的高级记忆系统

arXiv cs.AI

本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。

δ-mem:大型语言模型的高效在线记忆机制

Hugging Face Daily Papers

本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。