Black-Mamba: 生物启发的泄漏累积方法用于分布漂移下的概念知识
摘要
Black-Mamba提出了一种测试时自适应预测架构,利用累积惊异度仅在检测到分布漂移证据时选择性更新记忆,从而在非平稳时间序列上实现高效自适应。
arXiv:2607.18899v1 公告类型:新
摘要:实际条件下的预测本质上是非平稳的,因为未来观测的条件分布随时间演变。最近的测试时自适应序列模型通过在推理过程中更新内部状态来应对这一挑战,但将自适应与瞬时预测误差或惊异度绑定。这种耦合可能将持续的分布偏移与随机创新混为一谈,导致不必要的更新和低效的自适应。我们引入了Black-Mamba,一种测试时自适应预测架构,将在线自适应形式化为分布漂移下的证据门控状态跟踪。该模型通过一个动态记忆来增强基础预测器,该记忆仅在时间累积的惊异度提供足够证据表明状态变化时更新。这使得自适应成为一个选择性、事件驱动的过程,而非连续过程。在多个具有非平稳动态的预测基准测试中,Black-Mamba相比现有测试时自适应方法取得了具有竞争力或更优的预测性能,同时显著减少了推理过程中的记忆更新次数。结合数学分析和生物学证据,这些结果表明累积惊异度为区分持续漂移与瞬态噪声提供了一个有原则的信号,从而实现更高效、更鲁棒的自适应。
查看缓存全文
缓存时间: 2026/07/22 08:22
# Black-Mamba: 受生物启发的泄漏累积用于分布漂移下的概念性知识 来源:https://arxiv.org/html/2607.18899 朱塞佩·索里亚诺(Giuseppe Soriano) 比萨大学 & 国家研究委员会(CNR)比萨,意大利 [email protected] &尼古拉·托内洛托(Nicola Tonellotto) 比萨大学,意大利 [email protected] &阿尔贝托·戈塔(Alberto Gotta) 国家研究委员会(CNR)比萨,意大利 [email protected] ###### 摘要 现实条件下的预测本质上是非平稳的,因为未来观测的条件分布随时间演化。最近的测试时自适应序列模型通过在推理过程中更新内部状态来应对这一挑战,但将自适应与瞬时预测误差或惊奇度耦合在一起。这种耦合可能将持续的分布漂移与随机创新混淆,导致不必要的更新和低效的自适应。我们提出了*Black-Mamba*,一种测试时自适应预测架构,它将在线自适应形式化为分布漂移下基于证据门控的状态跟踪。该模型通过动态记忆增强基础预测器,当时间累积的惊奇度提供足够证据表明机制变化时,才更新该记忆。这使得自适应成为一个选择性的、事件驱动的过程,而非连续过程。在多个具有非平稳动态特性的预测基准测试中,*Black-Mamba*与现有的测试时自适应方法相比,取得了有竞争力或更优的预测性能,同时显著减少了推理期间记忆更新的次数。结合数学分析和生物学证据,这些结果表明,累积惊奇度提供了一个原则性的信号,用以区分持续性漂移和瞬态噪声,从而实现更高效、更鲁棒的自适应。 ## 1 引言 时间序列预测通常被视为一个固定数据集上的监督学习问题,但在许多实际场景中,目标分布本身是随时间变化的。电力需求随天气模式与人类行为的演变而变化;车辆交通流量随基础设施与社会节奏而发生漂移;互联网流量分布因新兴应用(如视频、AI驱动服务)的动态互动、用户行为模式的演变、协议与平台的变化而随时间改变;生理信号随潜在临床状态的变化而变化;金融或工业过程则受到仅部分可观测的结构性变化的影响。在这些场景中,主要困难不仅在于对长程依赖关系的建模,还在于追踪一个不断变化的环境。 这一观察产生了两个主要研究方向。前者改进序列模型的*归纳偏置*。基于分块的Transformer表明,注意力机制在预测中表现不佳的感知,很大程度上源于次优的符号化与通道混合,而非注意力本身(Nie等人, 2023 (https://arxiv.org/html/2607.18899#bib.bib17))。状态空间模型和选择性循环模型则强调时间偏置、线性复杂度和长上下文的稳定性(Patro和Agneeswaran, 2024 (https://arxiv.org/html/2607.18899#bib.bib19))。最近的多元架构明确将时间和变量维度视为不同但耦合的轴,认为二维归纳偏置对于多元预测至关重要(Cao等人, 2025 (https://arxiv.org/html/2607.18899#bib.bib23); Behrouz等人, 2025a (https://arxiv.org/html/2607.18899#bib.bib30); Meskin等人, 2025 (https://arxiv.org/html/2607.18899#bib.bib26))。这一方向的工作不可或缺,但它仍然在很大程度上假设一个设计足够好的静态模型足以解释整个序列。 后者则从静态推理转向*在线自适应*。持续测试时自适应方法从未标记的目标流中更新模型参数,以追踪非平稳域(Wang等人, 2022 (https://arxiv.org/html/2607.18899#bib.bib15))。测试时训练层将隐藏状态重新解释为一个可训练模型,其参数在推理过程中更新(Sun等人, 2025 (https://arxiv.org/html/2607.18899#bib.bib29))。Titans及后续的神经记忆架构认为,长期记忆应在测试时显式写入,使预测器能够以标准有限窗口注意力无法做到的方式对上下文作出反应(Behrouz等人, 2024 (https://arxiv.org/html/2607.18899#bib.bib20), 2025b (https://arxiv.org/html/2607.18899#bib.bib21))。这一方向很有吸引力,因为它承认了问题的移动目标特性。然而,大多数现有公式均由瞬时损失或惊奇度驱动,因此隐含地假设每个足够大的预测误差都是持续性漂移的证据。这一假设对于非平稳预测来说过于强烈。 预测误差是结构化漂移与不可预测创新的混合体。如果模型在每个时间步都更新其长期记忆,它不仅会对条件分布的持续性变化做出反应,还会对异常值、瞬态波动和不可约噪声做出反应。因此,在线可塑性可能变成方差放大、误差累积或灾难性遗忘,而非真正的自适应(Wang等人, 2022 (https://arxiv.org/html/2607.18899#bib.bib15); Luo等人, 2025 (https://arxiv.org/html/2607.18899#bib.bib24))。因此,关键未解问题并非是否应该进行自适应,而是*何时*进行。 我们的出发点是,漂移下的预测应被表述为*在线状态估计*。我们通过一个潜在的机制状态对环境进行建模,该状态随时间演化并改变下一观测的条件分布。那么,一个记忆增强的预测器之所以有用,并非因为它盲目地对惊奇度做出反应,而是因为它的记忆可以作为该潜在机制的隐式估计器。这一视角表明,更新机制应是选择性的:它应对分布变化的持续性证据做出响应,同时抑制零均值创新。 本文提出了*Black-Mamba*,一种用于推理时自适应的事件触发式记忆架构。生物学直觉源于记忆神经科学中的两个经典思想。首先,长时程增强表明,持久的记忆痕迹源于足够强或重复的激活,而非每一次局部扰动(Bliss和Lømo, 1973 (https://arxiv.org/html/2607.18899#bib.bib1); Lynch, 2004 (https://arxiv.org/html/2607.18899#bib.bib3); Nicoll, 2017 (https://arxiv.org/html/2607.18899#bib.bib8))。其次,突触标记与捕获将瞬态资格与持久巩固分离开来:局部事件创造了记忆的可能性,但持久性需要时间上协调的强化(Redondo和Morris, 2011 (https://arxiv.org/html/2607.18899#bib.bib6); Viola等人, 2014 (https://arxiv.org/html/2607.18899#bib.bib7); Luboeinski和Tetzlaff, 2021 (https://arxiv.org/html/2607.18899#bib.bib14))。我们将这种记忆巩固观点与泄漏积分触发原理相结合,其中证据随时间累积并衰减,只有阈值交叉才会触发离散事件(Burkitt, 2006 (https://arxiv.org/html/2607.18899#bib.bib5); Brette和Gerstner, 2005 (https://arxiv.org/html/2607.18899#bib.bib4); Gerstner和Kistler, 2002 (https://arxiv.org/html/2607.18899#bib.bib2))。 统计学上的直觉是平行的。如果漂移可分解为一个可预测分量和一个创新分量,那么时间上的证据积分可以增强信噪比:持续的偏差会一致性累积,而类鞅噪声则保持中心化且有界。这产生了一个自然的架构原则。我们不直接从瞬时损失更新记忆,而是先通过一个泄漏积分器过滤标量惊奇度信号,并仅当积分证据超过阈值时才更新记忆。这样,自适应不再与每一次局部失配耦合,而只与那些持续足够长、具有统计意义偏差的观察结果耦合。 本文做出三项贡献。首先,将非平稳预测形式化为关于一个时间索引的条件分布族的预测问题,并精确区分了已解释变异与真实未解决漂移。其次,提出了*Black-Mamba*,一种记忆增强架构,其更新机制由惊奇度累积事件触发,而非瞬时损失触发。第三,提供了一个数学证明,表明在明确的鞅噪声假设下,证据门控更新能够抑制创新噪声,累积持续漂移,并控制虚假触发概率,从而支持将其作为推理时学习的一般原则。 ## 2 问题形式化 令T⊆N\\mathcal\{T\}\\subseteq\\mathbb\{N\}表示时间。在时间t∈Tt\\in\\mathcal\{T\},我们观察到信息I\(t\)\\mathcal\{I\}\(t\),然后目标变量Y\(t\+1\)∈YY\(t\+1\)\\in\\mathcal\{Y\}根据一个条件分布生成:Y\(t\+1\)∼Pt,Pt:=P\(⋅∣I\(t\)\)。Y\(t\+1\)\\sim P\_\{t\},\\qquad P\_\{t\}:=P\(\\cdot\\mid\\mathcal\{I\}\(t\)\)。可用的信息可能是同一过程的近期历史(如在单变量自回归预测中),或是一个包含滞后项、外生变量、日历特征和元数据的多元协变量向量。学习目标是从I\(t\)\\mathcal\{I\}\(t\)预测Y\(t\+1\)Y\(t\+1\)。与标准公式的关键区别在于,我们不假设PtP\_\{t\}是常数。相反,我们考虑一个时间索引的条件分布族:P:T→P\(Y\),P:\\mathcal\{T\}\\to\\mathcal\{P\}\(\\mathcal\{Y\}\),并聚焦于t↦Ptt\\mapsto P\_\{t\}随时间演化的非平稳状态。一个有用的解释是,条件分布由一个潜在的环境状态z\(t\)∈Zz\(t\)\\in\\mathcal\{Z\}所调控,使得Pt=P\(⋅∣I\(t\),z\(t\)\),z\(t\+1\)=F\(z\(t\)\)\+η\(t\),P\_\{t\}=P\(\\cdot\\mid\\mathcal\{I\}\(t\),z\(t\)\),\\qquad z\(t\+1\)=F\(z\(t\)\)\+\\eta\(t\),其中FF捕捉结构化的机制动态,η\(t\)\\eta\(t\)是创新项。在此视角下,最优预测器ft⋆\(I\(t\)\):=E[Y\(t\+1\)∣I\(t\)]f\_\{t\}^\{\\star\}\(\\mathcal\{I\}\(t\)\):=\\mathbb\{E\}\[Y\(t\+1\)\\mid\\mathcal\{I\}\(t\)\]其本身也是随时间变化的。 #### 已解释变异 vs. 真实漂移。 并非所有的时间变化都应被解释为未解决的漂移。如果相关的机制信息已能从观测输入中重建出来,那么时间变化就是由条件作用*解释*的,不应触发自适应。这一区分对时间序列很重要,因为许多重复出现的效应(如日周期或周周期)一旦包含适当的协变量便会消失。我们保留术语*分布漂移*用于在条件作用于可用信息后,条件分布中剩余的时间变化。为了量化漂移,定义形式增量Δ\(t\):=Pt\+1−Pt,\\Delta\(t\):=P\_\{t\+1\}\-P\_\{t\},其大小可通过一个差异度量d\(Pt\+1,Pt\)d\(P\_\{t\+1\},P\_\{t\}\)来测量,例如全变差、KL散度或Wasserstein距离。核心统计问题是观测到的时间变化是否包含一个可预测分量,还是以创新噪声为主。令Ht\\mathcal\{H\}\_\{t\}表示截至时间tt的可观测历史。我们将漂移分解为Δ\(t\)=Δpred\(t\)\+Δnoise\(t\),\\Delta\(t\)=\\Delta\_\{\\mathrm\{pred\}\}\(t\)\+\\Delta\_\{\\mathrm\{noise\}\}\(t\),其中Δpred\(t\):=E[Δ\(t\)∣Ht],E[Δnoise\(t\)∣Ht]=0。\\Delta\_\{\\mathrm\{pred\}\}\(t\):=\\mathbb\{E\}\[\\Delta\(t\)\\mid\\mathcal\{H\}\_\{t\}\],\\qquad\\mathbb\{E\}\[\\Delta\_\{\\mathrm\{noise\}\}\(t\)\\mid\\mathcal\{H\}\_\{t\}\]=0。这一分解是本文的概念核心。只有当累积的可预测分量在任务相关的时间尺度上足够大,以至于超过创新过程的集中尺度时,预测问题才是有意义的。否则,没有自适应机制能够可靠地区分漂移和噪声。这一观点也阐明了标准损失驱动更新的局限性。如果时间tt的预测损失为lt:=l\(ft\(I\(t\)\),Y\(t\+1\)\),\\ell\_\{t\}:=\\ell\\\!\\left\(f\_\{t\}\(\\mathcal\{I\}\(t\)\),Y\(t\+1\)\\right\),那么lt\\ell\_\{t\}同时受到Δpred\(t\)\\Delta\_\{\\mathrm\{pred\}\}\(t\)和Δnoise\(t\)\\Delta\_\{\\mathrm\{noise\}\}\(t\)的影响。因此,直接对lt\\ell\_\{t\}或其梯度做出反应的更新规则缺乏明确的机制来区分持续性漂移和瞬态创新。 ## 3 Black-Mamba 架构 ### 3.1 基础预测器与自适应记忆 我们考虑如下形式的预测器:Y^\(t\+1\)=fθ,φt\(I\(t\)\),\\hat\{Y\}\(t\+1\)=f\_\{\\theta,\\phi\_\{t\}\}\(\\mathcal\{I\}\(t\)\),其中θ\\theta是静态骨干网络参数,φt\\phi\_\{t\}是在推理过程中自适应的动态记忆状态。这遵循了现代自适应序列模型的一般记忆增强观点(Behrouz等人, 2024 (https://arxiv.org/html/2607.18899#bib.bib20); Sun等人, 2025 (https://arxiv.org/html/2607.18899#bib.bib29); Behrouz等人, 2025b (https://arxiv.org/html/2607.18899#bib.bib21)):骨干网络提供稳定的表示,而记忆则追踪不断变化的局部机制。架构上的解释是,φt\\phi\_\{t\}充当潜在状态z\(t\)z\(t\)的隐式估计器。在理想情况下,φt≈h\(z\(t\)\)\\phi\_\{t\}\\approx h\(z\(t\)\)对于某个任务相关的表示hh,因此在线自适应φt\\phi\_\{t\}等价于追踪潜在环境。然而,与标准的Titans风格记忆不同,Black-Mamba并非在每个时间步都写入记忆。 ### 3.2 从惊奇度到证据 令sts\_\{t\}表示从当前预测误差导出的标量惊奇度信号。我们将构造保持抽象,写作st=ψ\(lt\),s\_\{t\}=\\psi\(\\ell\_\{t\}\),其中ψ\\psi可以是恒等映射、归一化损失,或从预测残差计算出的其他标量统计量。我们假设该信号本身可分解为st=at\+ξt,s\_\{t\}=a\_\{t\}+\\xi\_\{t\},其中ata\_\{t\}是由可预测漂移引起的分量,ξt\\xi\_\{t\}是满足E[ξt∣Ht−1]=0\\mathbb\{E\}\[\\xi\_\{t\}\\mid\\mathcal\{H\}\_\{t\-1\}\]=0的创新项。 关键的架构举动是将*局部惊奇度*从*记忆提交*中解耦出来。我们引入一个泄漏证据累积器:ut=λut−1\+st,0<λ<1,u\_\{t\}=\\lambda u\_\{t\-1\}+s\_\{t\},\\qquad 0<\\lambda<1,它集成了近期证据同时丢弃陈旧信息。记忆仅在累积证据超过阈值时更新:若ut≥τ,则φt\+1=U\(φt,∇φlt\),\\text\{if \}u\_\{t\}\\geq\\tau,\\quad\\phi\_\{t\+1\}=\\mathcal\{U\}\\\!\\left\(\\phi\_\{t\},\\nabla\_\{\\phi\}\\ell\_\{t\}\\right\),否则φt\+1=φt。\\phi\_\{t\+1\}=\\phi\_\{t\}。更新后,累积器会重置或部分衰减:ut←ρut,0≤ρ<1。u\_\{t\}\\leftarrow\\rho u\_\{t\},\\qquad 0\\leq\\rho<1。作为具体实例,我们将记忆更新实现为一个局部梯度步骤:U\(φt,∇φlt\)=φt−η∇φlt,\\mathcal\{U\}\\\!\\left\(\\phi\_\{t\},\\nabla\_\{\\phi\}\\ell\_\{t\}\\right\)=\\phi\_\{t\}-\\eta\\nabla\_\{\\phi\}\\ell\_\{t\},但任何局部测试时自适应算子均可替代此步骤。 #### 架构总结。 因此,Black-Mamba是一个三阶段系统: 1. 1. 一个骨干预测器fθ,φtf\_\{\\theta,\\phi\_\{t\}\},输出下一步预测; 2. 2. 一个惊奇度编码器ψ\(lt\)\\psi\(\\ell\_\{t\}\),将瞬时误差转换为标量证据信号; 3. 3. 一个泄漏事件触发器,决定当前证据是否足以证明应进行持久记忆更新。
相似文章
PIMSM: 物理信息驱动的多尺度Mamba:分布偏移下稳定的神经表示
本文提出物理信息驱动的多尺度Mamba(PIMSM),这是一种状态空间架构,它将模型记忆与物理时间尺度对齐,以提升在科学时间序列分布偏移下的鲁棒性,并在fMRI和天气预报任务上展示了改进。
ReTAMamba:用于不规则临床时间序列预测的可靠性感知时间聚合与Mamba方法
提出ReTAMamba,一种使用基于Mamba的可靠性感知时间聚合进行不规则临床时间序列预测的方法,在MIMIC-IV、eICU和PhysioNet 2012上取得了显著的AUPRC提升。
MambaLSTM:一种用于增强交通事故风险预测的时空框架
本文提出MambaLSTM,一种结合Mamba状态空间模型和LSTM的框架,用于时空交通事故风险预测,解决了特征融合中的噪声和全局空间关联问题。
有人真的解决了记忆漂移问题吗?
讨论AI系统中的记忆漂移问题:偏好和事实会过时,但系统只追加存储新信息,导致版本冲突和检索不可靠。
基于注意力的经验回放框架:用于不可知时间序列预测模型的持续学习
本文提出了一种新颖的持续学习框架,用于时间序列预测,该框架利用注意力引导的经验回放,使模型能够适应新的数据分布,同时避免灾难性遗忘。该框架在标准基准和真实世界的水位数据上进行了评估。