MIITA:内存诱导的推理时自适应——用于小语言模型的持续学习

arXiv cs.AI 论文

摘要

MIITA是一个内存诱导的推理时自适应框架,专为小语言模型的持续学习设计。它存储修正方向原型,并在推理时应用门控隐藏状态自适应,从而在不更新主干参数的情况下缓解灾难性遗忘。

arXiv:2607.22556v1 公告类型:新提交 摘要:持续学习(CL)对于小语言模型(SLM)在资源受限部署中适应不断变化的现实需求至关重要。然而,直接更新其有限的参数空间会导致灾难性遗忘。虽然基于内存的方法通过将知识保留与参数解耦来自然解决这一问题,但现有为大型语言模型(LLM)设计的方法依赖于充足的存储和强大的上下文推理能力,而这些正是SLM所缺乏的。为解决这些挑战,我们提出MIITA,一种在存储受限条件下用于有监督持续学习的内存诱导推理时自适应框架。MIITA将监督经验存储为带有语义锚点的紧凑修正方向原型,并在推理时利用语义和不确定性线索进行检索。检索到的方向通过门控临时隐藏状态自适应进行应用,从而在不进行主干更新、提示扩展或测试时反向传播的情况下,实现对先前监督经验的无损重用。局部理论分析将该设计与一阶损失减少、不确定性引导的检索以及用于保留旧阶段知识的方向覆盖联系起来。在多种有监督持续学习设置下的大量实验表明,MIITA在固定内存预算下持续提升了最终性能并缓解了遗忘。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:23

# MIITA:面向小型语言模型持续学习的内存诱导推理时自适应
来源:https://arxiv.org/html/2607.22556
Yanchi LiuNEC Laboratories America \{yanchi, xuzhao, weicheng, zchen, haifeng\}@nec\-labs\.comXujiang ZhaoNEC Laboratories America \{yanchi, xuzhao, weicheng, zchen, haifeng\}@nec\-labs\.comWei ChengNEC Laboratories America \{yanchi, xuzhao, weicheng, zchen, haifeng\}@nec\-labs\.comZhengzhang ChenNEC Laboratories America \{yanchi, xuzhao, weicheng, zchen, haifeng\}@nec\-labs\.comXintao WuUniversity of Arkansas xintaowu@uark\.eduZhong ChenSouthern Illinois University zhong\.chen@cs\.siu\.eduChen ZhaoBaylor University \{dong\_li1, chen\_zhao\}@baylor\.eduHaifeng ChenNEC Laboratories America \{yanchi, xuzhao, weicheng, zchen, haifeng\}@nec\-labs\.com

###### 摘要

持续学习(CL)对于小型语言模型(SLM)在资源受限的部署场景中适应不断变化的现实需求至关重要。然而,直接更新其有限的参数空间会导致灾难性遗忘。虽然基于记忆的方法通过将知识保留与参数解耦来自然解决这一问题,但为大型语言模型(LLM)设计的现有方法依赖于充足的存储和SLM所缺乏的强上下文推理能力。为应对这些挑战,我们提出了MIITA,一种面向约束存储下监督式持续学习的内存诱导推理时自适应框架。MIITA将监督式经验存储为紧凑的修正方向原型,并附带语义锚点;在推理时,通过语义和基于不确定性的线索进行检索。检索到的方向通过门控的临时隐藏状态自适应进行应用,从而无需骨干网络更新、提示扩展或测试时反向传播,即可实现过去监督信息的非破坏性重用。局部理论分析将该设计与一阶损失降低、不确定性引导的检索以及用于保留旧阶段知识的方向覆盖联系起来。在多种监督式持续学习设置下的大量实验表明,MIITA在固定内存预算下持续提升了最终性能并减轻了遗忘。

## 1 引言

小型语言模型(SLM)越来越多地被部署在本地化、低延迟、对隐私敏感且资源受限的环境中,它们需要持续适应不断变化的现实需求\[14 (https://arxiv.org/html/2607.22556#bib.bib22),24 (https://arxiv.org/html/2607.22556#bib.bib23)\]。然而,仅通过参数空间来为SLM实现持续学习(CL)从根本上来说就很困难。它们有限的容量和高度的表征冗余意味着,反复将新经验写入骨干网络会导致严重的灾难性遗忘和不稳定的更新\[5 (https://arxiv.org/html/2607.22556#bib.bib1),2 (https://arxiv.org/html/2607.22556#bib.bib2),21 (https://arxiv.org/html/2607.22556#bib.bib3)\]。
因此,关键挑战在于如何在不覆盖稀缺参数空间的情况下持续利用新的监督式经验。

基于记忆的持续学习通过将经验保留与模型的参数空间解耦,从而使得骨干网络保持稳定,同时辅助存储积累新知识,自然地解决了这一问题\[20 (https://arxiv.org/html/2607.22556#bib.bib29),16 (https://arxiv.org/html/2607.22556#bib.bib24),7 (https://arxiv.org/html/2607.22556#bib.bib25)\]。
然而,现有以LLM为中心的记忆方法很难迁移到SLM,因为它们通常将过去的经验保留为文本示例、摘要或演示\[18 (https://arxiv.org/html/2607.22556#bib.bib6),3 (https://arxiv.org/html/2607.22556#bib.bib26)\]。在固定预算下,此类记忆的存储效率低下:它们除了保留可重用的修正信号外,还保留了表面内容,并且功能冗余的经验难以以文本形式整合\[15 (https://arxiv.org/html/2607.22556#bib.bib28)\]。此外,它们依赖于强大的上下文推理能力来推断检索到的记忆应如何影响预测,而这种能力在较小模型中受到限制\[26 (https://arxiv.org/html/2607.22556#bib.bib27)\]。
如图1 (https://arxiv.org/html/2607.22556#S1.F1)所示,代表性基于记忆的LLM持续学习方法的性能随着基础模型规模的减小而显著下降,尤其是在固定存储预算下。这一趋势突显了SLM面临的关键双重瓶颈:在紧张的存储限制下无法维持海量文本记忆,以及在推理时无法有效利用这些记忆的有限能力。

参见图表标注图 1:基于LLM的记忆型持续学习基线方法CIS\[18 (https://arxiv.org/html/2607.22556#bib.bib6)\]和FOREVER\[6 (https://arxiv.org/html/2607.22556#bib.bib5)\]在SuperNI\[27 (https://arxiv.org/html/2607.22556#bib.bib19)\]基准上的模型规模缩放效果。“-B”后缀表示受限于固定内存预算的变体,与其无约束版本形成对比。我们评估了整体性能(OP)和后向迁移(BWT);数值越高分别表示准确率越高和遗忘越少。

克服这一双重瓶颈需要重新思考记忆项应该保留什么。受von Oswald等人\[25 (https://arxiv.org/html/2607.22556#bib.bib18)\]的启发,他们将上下文示例描述为在前向传播过程中诱导类似梯度下降的局部修正,一个记忆项的价值不仅在于其原始的语义内容本身,更在于它对模型隐藏表示施加的功能性修正。这一视角揭示了语义冗余与功能冗余之间的分歧:语义不同的示例可能引发相同的修正,因此可以合并,而语义相似的示例可能需要不同的修正。因此,一种替代范式不是保留历史文本并期望SLM推断如何使用它,而是直接围绕可重用的自适应方向来组织记忆。以紧凑形式存储这些功能信号,既能应对紧张的存储限制,也能减轻对上下文推理的依赖。

受此范式启发,我们提出了MIITA,一个面向约束持久存储下监督式持续学习的SLM内存诱导推理时自适应框架。MIITA将每个监督式经验转换为模型内部隐藏空间中的一个紧凑修正方向,将这些功能信号整合到预算感知的记忆原型中,仅将语义锚点用作轻量级的检索键。在推理时,该框架通过语义相关性和基于不确定性的方向代理来检索相关的历史方向。这些方向被聚合成一个查询特定的修正,并通过门控的临时隐藏状态更新来直接指导预测。这种自适应是一次性的,不需要永久参数更新、测试时反向传播或冗长的提示扩展。我们的主要贡献总结如下:

- •我们提出了一种面向方向的记忆表示,将监督式经验存储为修正方向原型,并附带轻量级语义锚点,克服了SLM中传统文本记忆的高存储和推理成本。
- •我们引入了一种内存诱导的推理时自适应机制,通过门控的临时隐藏状态更新来应用检索到的历史方向,安全地重用过去的监督信息,无需测试时反向传播或破坏性骨干网络更新。
- •我们提供了局部理论分析,表明修正方向对于降低监督损失是一阶最优的,不确定性方向识别出降低局部预测熵的最陡方向,并作为无标签的检索线索,而旧阶段知识的保留由存储记忆的方向覆盖控制。
- •我们在多种持续学习设置下进行了全面的实证评估,表明MIITA在固定内存预算下提高了最终性能并减少了遗忘。进一步的分析证明了其跨模型规模和内存预算的鲁棒性,以及功能性修正记忆和不确定性引导检索的有效性。

## 2 相关工作

面向SLM的持续学习。SLM的持续学习对于资源受限的部署至关重要,但尚未得到充分探索。现有方法通过各种机制解决灾难性遗忘问题:DKVB\[5 (https://arxiv.org/html/2607.22556#bib.bib1)\]通过离散键值瓶颈进行局部更新;DA-GRPO\[2 (https://arxiv.org/html/2607.22556#bib.bib2)\]优化持续后训练,同时学习在云协助预算下调用云端LLM;Srinath K等人\[21 (https://arxiv.org/html/2607.22556#bib.bib3)\]使用POS引导的代码切换,通过重放适配器减轻跨语言遗忘。然而,这些方法仍然依赖于训练时的参数更新、云端协助或样本重放。相比之下,MIITA通过绕过持久的骨干网络修改和训练时重放来解决这些局限,从而克服了SLM在持续微调和基于文本的提示中的固有不稳定性。

面向LLM的基于记忆的持续学习。现有面向LLM的基于记忆的持续学习方法通常根据记忆使用的时间分为两类。训练时重放方法在优化过程中重用存储的示例;例如,Continual-T0 (CT0)\[19 (https://arxiv.org/html/2607.22556#bib.bib4)\]使用小型排练缓冲区来保留先前能力,而FOREVER\[6 (https://arxiv.org/html/2607.22556#bib.bib5)\]根据更新动态安排记忆回顾。或者,像CIS\[18 (https://arxiv.org/html/2607.22556#bib.bib6)\]和InCA\[17 (https://arxiv.org/html/2607.22556#bib.bib7)\]这样的推理时方法利用文本摘要或上下文示例来避免遗忘,同时不更新LLM。其他推理时方法(例如MAC\[22 (https://arxiv.org/html/2607.22556#bib.bib8)\], CMT\[13 (https://arxiv.org/html/2607.22556#bib.bib9)\], HippoRAG 2\[8 (https://arxiv.org/html/2607.22556#bib.bib10)\], MBC\[10 (https://arxiv.org/html/2607.22556#bib.bib11)\])检索外部文档以进行持续知识更新。然而,这些方法主要关注知识增强,而不是直接解决监督式持续学习中的任务级遗忘,这与我们的目标问题不同。此外,其余以LLM为中心的方法不适用于SLM,因为在SLM中,有限的容量和较弱的上下文能力使得重放和文本记忆不可靠。相比之下,MIITA将监督式经验存储为紧凑的功能性修正方向,在推理时通过轻量级、无需优化的隐藏状态自适应来调用它们。

## 3 方法

### 3.1 问题设定

我们研究在约束持久辅助存储预算下,面向小型语言模型(SLM)的监督式持续学习(CL)。一个SLM接收数据阶段的序列Dstream=\{D1,...,DT\}\mathcal\{D\}\_\{\\mathrm\{stream\}\}=\\\{\mathcal\{D\}\_\{1\},\\ldots,\mathcal\{D\}\_\{T\}\\\},其中每个阶段Dt=\{\(xit,yit\)\}i=1Nt\\mathcal\{D\}\_\{t\}=\\\{\(x\_\{i\}^\{t\},y\_\{i\}^\{t\}\)\\\}\_\{i=1\}^\{N\_\{t\}\}包含监督式的输入-输出示例。在每个阶段之后,CL算法更新其系统状态,这可能包括模型参数和/或辅助持久信息,例如重放样本、摘要、提示、适配器、统计信息或记忆项。为反映SLM部署的资源约束,该辅助持久信息的总大小受限于固定的存储预算CmemC\_\{\\mathrm\{mem\}\}。目标是在从每个新阶段学习的同时,保持所有先前阶段上的性能,即最大化最终的平均性能并最小化遗忘。

### 3.2 MIITA:内存诱导的推理时自适应

为了解决SLM在预算约束下的监督式持续学习,我们引入了MIITA,一个内存诱导的推理时自适应框架。该框架通过将历史监督信息保留为紧凑的修正方向而非原始示例或文本摘要,将长期经验保留与冻结的模型参数空间解耦。针对SLM有限的容量和较弱的上下文能力,MIITA将持续记忆建模为可重用的自适应信号:在持续学习期间,监督式经验被转换为前LM头的修正方向,然后记忆管理器将这些方向组织成预算感知的原型,并附带用于检索的语义键。在推理时,MIITA使用语义和不确定性线索检索相关原型,并通过门控的临时隐藏更新来应用它们。我们为修正方向提取、基于不确定性的检索、临时隐藏自适应和方向记忆覆盖提供了局部理论分析;正式陈述和证明见附录A (https://arxiv.org/html/2607.22556#A1)。MIITA的整体框架如附录B.2 (https://arxiv.org/html/2607.22556#A2.SS2)中的算法1 (https://arxiv.org/html/2607.22556#alg1)所示。

#### 3.2.1 面向方向的记忆表示

MIITA维护一个记忆库B=\{u1,...,uJ\}\\mathcal\{B\}=\\\{u\_\{1\},\\ldots,u\_\{J\}\\\},其中每个单元是一个方向原型:

uj=\(dj,Aj,nj\)。u\_\{j\}=\(d\_\{j\},\\mathcal\{A\}\_\{j\},n\_\{j\}\)。这种设计反映了在SLM中将功能保留与语义访问分离的需求,而SLM由于更紧张的上下文预算和更弱的上下文能力,无法可靠地依赖大型文本记忆。原型方向dj∈RHd\_\{j\}\\in\\mathbb\{R\}^\{H\}是前LM头隐藏空间中的一个归一化修正方向,作为主要存储信号,保留了历史监督经验的功能性自适应效果。锚集Aj\\mathcal\{A\}\_\{j\}包含轻量级语义键,仅用于从不同查询上下文中检索此功能信号,而njn\_\{j\}记录已合并到原型中的经验数量。记忆库B\\mathcal\{B\}在全局存储预算CmemC\_\{\\mathrm\{mem\}\}下维护,该预算在记忆写入过程中通过记忆修复强制执行(当新方向或锚点超出预算时),详见第3.2.3 (https://arxiv.org/html/2607.22556#S3.SS2.SSS3)节。

#### 3.2.2 从经验中提取方向信号

给定一个监督式经验\(xm,ym\)\(x\_\{m\},y\_\{m\}\),MIITA提取两个信号:用于记忆访问的语义键kmk\_\{m\}和用于记忆写入的修正方向dmd\_\{m\}。

语义键。设Xm\\mathcal\{X\}\_\{m\}为输入词元位置,hr\(lk\)h\_\{r\}^\{\(\\ell\_\{k\}\)\}为层lk\\ell\_\{k\}处的隐藏状态。我们定义

km=Norm\(1\|Xm\|∑r∈Xmhr\(lk\)\)。k\_\{m\}=\\mathrm\{Norm\}\\left\(\\frac\{1\}\{\|\\mathcal\{X\}\_\{m\}\|\}\\sum\_\{r\\in\\mathcal\{X\}\_\{m\}\}h\_\{r\}^\{\(\\ell\_\{k\}\)\}\\right\)。\(1\)其中Norm\(v\)=v/\(‖v‖2\+ε\)\\mathrm\{Norm\}\(v\)=v/\(\\\|v\\\|\_\{2\}\+\\epsilon\)。键kmk\_\{m\}仅用于后续检索。

修正向量。我们在前LM头隐藏空间中定义修正信号,即最终隐藏状态在投影到词汇logits之前的空间。对于一个经验\(xm,ym\)\(x\_\{m\},y\_\{m\}\),其未归一化的修正向量RmR\_\{m\}为

Rm=1\|Ym\|∑t∈Ym\(−∂Lt∂htout\)=1\|Ym\|∑t∈YmWLM⊤\(eyt−pt\)。R\_\{m\}=\\frac\{1\}\{\|\\mathcal\{Y\}\_\{m\}\|\}\\sum\_\{t\\in\\mathcal\{Y\}\_\{m\}\}\\left\(\-\\frac\{\\partial\\mathcal\{L\}\_\{t\}\}\{\\partial h\_\{t\}^\{\\mathrm\{out\}\}\}\\right\)=\\frac\{1\}\{\|\\mathcal\{Y\}\_\{m\}\|\}\\sum\_\{t\\in\\mathcal\{Y\}\_\{m\}\}W\_\{\\mathrm\{LM\}\}^\{\\top\}\(e\_\{y\_\{t\}\}\-p\_\{t\}\)。\(2\)这里,Ym\\mathcal\{Y

相似文章

面向大型语言模型归因引导的持续学习

arXiv cs.LG

本文提出了一种面向大型语言模型的归因引导持续微调框架,该框架能够估计 Transformer 层中特定任务相关的参数重要性并相应地调节梯度,在保持新任务性能的同时缓解了灾难性遗忘。

Δ-Mem:大型语言模型的高效在线记忆

Hacker News Top

提出 delta-Mem,一种轻量级在线记忆机制,利用紧凑状态矩阵并通过增量规则学习进行更新,以提升冻结大型语言模型的长上下文性能,无需全量微调或上下文扩展。

δ-mem:大型语言模型的高效在线记忆机制

Hugging Face Daily Papers

本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。