演变概念定义下的溯源引导增量学习
摘要
本文提出了一种溯源引导的增量学习框架,用于处理由规则引发的概念漂移,其中目标定义发生变化,并在一个新的基准上进行了评估,以提高效率和准确性。
arXiv:2608.23893v1 公告类型:新
摘要:长期部署的学习系统必须不仅适应传入数据的统计变化,还要适应生成其预测目标的定义修订。传统的概念漂移方法通常从观察或预测错误中推断这些变化,即使底层策略、规则或查询已被明确修改。本文研究了规则引发的概念漂移,其中目标定义的概念被直接修订,导致先前存储的实例获得不同的语义标签,而无需对其观测数据进行任何更改。我们引入了一种溯源引导的增量学习框架,将连续的概念定义编译为结构化规则增量,通过历史溯源追踪更改的组件,验证先前标签仍然有效的记录,并将重新评估限制在局部候选区域。可执行的修订会自动重新标记,模糊情况通过选择性监督处理,而由此产生的更改用于增量预测器修复。版本化概念记忆进一步支持重复定义。我们还引入了RuleShift-Bench,涵盖金融、人口统计、网络安全和图结构数据,具有阈值、谓词、逻辑、关系、重复和混合概念修订。在基准测试中,溯源引导的修复达到了92.3%的准确率和90.2%的Macro-F1,同时重新处理了14.7%的历史集合并保留了94.6%的受影响记录。其平均更新延迟为179秒,而完整重新标记和重新训练为993秒。结果表明,明确的概念修订可以作为数据维护信号,允许学习系统更新依赖于更改的监督和预测状态,同时保留仍然有效的知识。
查看缓存全文
缓存时间: 2026/08/26 09:15
# 演化概念定义下的溯源引导增量学习 来源:https://arxiv.org/html/2608.23893 Ismail Lamaakal††thanks:Lamaakal\. I 任职于摩洛哥乌季达穆罕默德一世大学应用科学学院计算机科学系。通讯作者邮箱:ismail\.lamaakal@ieee\.org #### 摘要 长期部署的学习系统不仅必须适应传入数据的统计变化,还需适应生成其预测目标的定义修订。传统的概念漂移方法通常从观测值或预测误差中推断此类变化,即使底层策略、规则或查询已被明确修改。本文研究*规则诱导的概念偏移*,其中定义目标的概念被直接修订,导致先前存储的实例获得不同的语义标签,而无需其观测数据发生任何变化。我们引入了一个溯源引导的增量学习框架,该框架将连续的概念定义编译为结构化的规则增量,通过历史溯源追溯变化部分,验证先前标签仍然有效的记录,并将重新评估限制在局部候选区域内。可执行的修订被自动重新标记,模糊情况通过选择性监督处理,所产生的变化用于增量预测器修复。版本化的概念记忆进一步支持重复定义。我们还引入了 RuleShift-Bench 基准,涵盖金融、人口统计、网络安全和图结构数据,包含阈值、谓词、逻辑、关系、重复和混合概念修订。在整个基准测试中,溯源引导的修复在重新处理 14.7% 的历史记录并保留 94.6% 受影响记录的情况下,达到了 92.3% 的准确率和 90.2% 的 Macro-F1 分数。其平均更新延迟为 179 秒,而完整重新标记和重新训练则需要 993 秒。结果表明,明确的概念修订可以作为数据维护信号被利用,使学习系统能够更新依赖于该变化的监督和预测状态,同时保留仍然有效的知识。 #### 索引术语:概念漂移,数据溯源,增量学习。 ## I 引言 机器学习模型越来越多地部署在预测目标的意义随时间演变的环境中。欺诈检测、安全监控、合规性检查、资格评估、内容审核、推荐和风险管理是典型例子,在这些场景中,根据一个操作定义训练的模型可能稍后在修订后的定义下使用。最近关于在线欺诈检测和自适应入侵检测的研究说明了快速演变的行为如何降低在早期操作条件下学习到的模型的有效性[1 (https://arxiv.org/html/2608.23893#bib.bib1),2 (https://arxiv.org/html/2608.23893#bib.bib2),3 (https://arxiv.org/html/2608.23893#bib.bib3)]。因此,在此类环境中保持预测质量不仅是一个最初学习准确模型的问题,还是在目标语义发生变化时更新学习系统的问题。大量研究通过概念漂移和流学习的视角研究这一问题。最近的调查将概念漂移描述为控制演化数据流的统计过程的变化,并根据如何检测、定位和处理此类变化来组织现有方法[4 (https://arxiv.org/html/2608.23893#bib.bib4),5 (https://arxiv.org/html/2608.23893#bib.bib5),6 (https://arxiv.org/html/2608.23893#bib.bib6)]。在传统设置中,变化并非直接对学习者可用。相反,它必须从传入的观测值、预测误差、类别频率的变化或底层数据分布的偏移中推断出来。相应地,最近的工作研究了漂移局部性和基于分布的检测[7 (https://arxiv.org/html/2608.23893#bib.bib7),8 (https://arxiv.org/html/2608.23893#bib.bib8)],漂移类型感知的适应[9 (https://arxiv.org/html/2608.23893#bib.bib9)],自适应集成[10 (https://arxiv.org/html/2608.23893#bib.bib10)],流式神经适应[11 (https://arxiv.org/html/2608.23893#bib.bib11)],主动适应[12 (https://arxiv.org/html/2608.23893#bib.bib12)],以及分布式流环境中的漂移处理[13 (https://arxiv.org/html/2608.23893#bib.bib13)]。因此,漂移检测器、自适应分类器、在线学习器、重放机制和重复漂移方法主要关注识别当前预测器不再匹配演化环境,并在出现足够的变化证据后调整模型。当负责变化的机制隐藏时,这种观点是合适的。然而,许多数据密集型应用以不同的方式演变。目标可能由明确的策略、业务规则、合规规范、关系条件、图标准或专家定义的决策过程生成,而该定义本身可以被修订。例如,在交易监控系统中,早期的策略可能在交易金额超过五千单位或为国外交易时将其分类为可疑。修订后的策略可能将较低的交易阈值与设备不匹配相结合,并额外将涉及被屏蔽商家的交易进行分类。先前存储的交易无需任何改变,其正确标签就可能变得不同;改变的是用于解释该交易的定义。现有工作已开始从单纯检测漂移转向定位、表征和解释统计变化发生的位置[4 (https://arxiv.org/html/2608.23893#bib.bib4),14 (https://arxiv.org/html/2608.23893#bib.bib14),15 (https://arxiv.org/html/2608.23893#bib.bib15)],但这些方法仍然主要从数据、预测或学习关系的观测变化中推理,而不是从直接修订的目标生成规则中推理。这种情况暴露了将每个目标变化都视为普通统计漂移的重要局限性。如果修订后的定义已知,等待一系列预测失败来揭示变化,会丢弃系统直接可用的信息。更重要的是,检测到概念发生变化并不能识别哪些历史样本在语义上已失效。某些记录可能依赖于定义的修改部分,需要重新评估,而许多其他记录在修订前后的定义下都可能保持正确。这种区别与一个更广泛的观察相关,即漂移可以是局部的而非全局的,不同的变化可以影响数据空间的不同区域[7 (https://arxiv.org/html/2608.23893#bib.bib7),4 (https://arxiv.org/html/2608.23893#bib.bib4)]。然而,在我们的设置中,局部化问题始于目标定义计算的明确修改,而不是从统计检测到的分布变化开始。一个直接的应对方法是将修订后的定义应用于完整的历史数据库,重新生成每个训练标签,并从头开始重新训练预测器。虽然正确,但这种方法对于大型历史数据集来说可能不必要地昂贵。当概念定义包含关系连接、图依赖、历史聚合、外部服务或其他昂贵操作时,成本变得尤为显著。最近关于工业数据流的工作同样强调了重复适应的计算难度以及在操作条件演变时利用可重用知识的必要性[16 (https://arxiv.org/html/2608.23893#bib.bib16),17 (https://arxiv.org/html/2608.23893#bib.bib17)]。完全重新计算也忽略了这样一个事实:策略的局部修订可能只影响先前观测实例的一小部分。在另一个极端,仅从最近的观测中更新模型可能更便宜,但它无法保证那些语义标签已改变的旧样本得到适当的重新考虑。因此,核心问题不仅在于概念是否发生了变化,还在于已知的修订如何通过历史数据和预测状态传播。一个有用的维护机制应确定先前训练集合的哪些部分仍然可信,哪些记录需要重新评估,哪些修订后的标签可以自动生成,以及哪些情况需要额外监督。然后,它应该使用这种局部化的更新预测器,而不必要地重建仍然有效的知识。这推动了从传统的漂移检测向明确的概念定义维护的转变:与其从后续观测中间接重新发现已知的语义修订,修订本身可以被用来确定哪些历史监督和预测知识实际需要重新考虑。本文通过演化概念定义下的溯源引导增量学习来解决这个问题。该框架从先前和修订后的概念定义开始,识别它们之间的结构差异,并将该差异与描述历史结果如何依赖于谓词、属性、关系或计算路径的溯源信息相结合。可能受修订影响的历史记录被重新考虑,而结果可以被验证为稳定性的记录则被保留。然后,修订后的监督用于增量修复预测器,并且先前遇到的概念版本被保留,以便重复定义可以被高效恢复。由此产生的工作流程连接了通常独立处理的四个阶段。首先,系统确定概念定义中什么发生了变化。其次,它使用溯源来确定哪些历史记录依赖于该变化。第三,它仅对相关区域更新监督,包括在修订无法确定性执行时选择性的人工标注。最后,它在保留与未受影响数据相关的行为的同时修复预测器。这创建了一条从概念定义维护到训练数据维护,最终到模型维护的直接路径。因此,本工作解决的主要问题是:*给定概念定义的明确变化,学习系统能否确定哪些历史数据和预测状态实际需要重新考虑,而不是从后续预测误差中重新发现变化或重新计算整个历史集合?* 本工作的主要贡献如下: 1. 1. 我们引入了规则诱导的概念偏移,这是一种学习设置,其中生成目标的定义发生明确变化,而不仅仅是隐藏的统计漂移。该公式将已知的语义修订与其对历史监督和预测状态的影响分开。 2. 2. 我们开发了一种机制,该机制分析连续概念定义之间的差异,并使用历史溯源来识别可能需要重新评估的记录。当先前结果在修订后的定义下保持不变时,相同的机制验证未受影响的记录。 3. 3. 我们将针对可执行变化的自动重新标记、针对模糊修订的选择性人工监督、增量预测器更新以及重复概念版本的恢复结合在一个统一的维护框架中。 4. 4. 我们引入了 RuleShift-Bench,并在多个数据模态和概念修订下评估了所提出的框架,综合考虑预测质量、历史重处理、标注需求、更新延迟、存储开销以及重复概念下的恢复能力。 本文其余部分组织如下。第 II 节 (https://arxiv.org/html/2608.23893#S2) 回顾了关于概念漂移、增量和持续学习、查询演化以及数据溯源的文献。第 III 节 (https://arxiv.org/html/2608.23893#S3) 形式化了演化概念定义下的学习,并提出了所提出的溯源引导框架,包括规则增量编译、受影响数据发现、选择性监督、增量修复和版本化概念记忆。第 IV 节 (https://arxiv.org/html/2608.23893#S4) 建立了主要正确性属性,并分析了选择性维护在计算上有利的条件。第 V 节 (https://arxiv.org/html/2608.23893#S5) 介绍了 RuleShift-Bench,并评估了预测性能、计算效率、标注需求、重复概念、组件消融和失败模式。最后,第 VI 节 (https://arxiv.org/html/2608.23893#S6) 总结了主要发现,讨论了当前框架的局限性,并概述了未来的工作方向。 ## II 相关工作 本节回顾与演化概念定义相关的主要研究领域,包括概念漂移与流学习、增量与持续学习、增量查询处理以及数据溯源。 ### II-A 概念漂移与流学习 概念漂移和流学习研究在变化的数据生成环境下的预测。现有工作包括统计漂移检测、自适应流分类器、在线学习、主动适应、动态窗口机制以及重复漂移处理机制[20 (https://arxiv.org/html/2608.23893#bib.bib20),21 (https://arxiv.org/html/2608.23893#bib.bib21)]。这些方法通常监测预测误差、特征分布、标签分布或其他流统计量,并在观测到足够的变化证据时适应学习器[18 (https://arxiv.org/html/2608.23893#bib.bib18),19 (https://arxiv.org/html/2608.23893#bib.bib19)]。重复漂移方法还会在早期统计状态重现时保留或恢复先前有用的模型。我们设置的核心区别在于目标定义规则的变化是明确可用的。我们不是从后续观测中统计推断发生了漂移,而是直接分析已知的修订,并确定它如何改变历史监督。 ### II-B 增量与持续学习 增量和持续学习解决预测模型如何在不反复从头训练的情况下融入新信息的问题。代表性方法包括重放、防止遗忘的正则化、在线参数更新、增量分类器以及动态或自适应集成[24 (https://arxiv.org/html/2608.23893#bib.bib24),25 (https://arxiv.org/html/2608.23893#bib.bib25)]。这些技术为高效更新预测器和保留先前学习的知识提供了机制,因此与本工作考虑的模型修复阶段是互补的[22 (https://arxiv.org/html/2608.23893#bib.bib22),23 (https://arxiv.org/html/2608.23893#bib.bib23)]。然而,它们通常假设用于适应的样本已经被识别。它们通常不使用目标定义的明确变化来确定哪些历史样本在语义上已失效,哪些仍然正确。因此,我们的关注点先于传统的增量更新:我们首先确定哪些历史监督实际需要重新考虑,然后使用该局部化的变化修复预测器。 ### II-C 增量查询处理与查询演化 增量查询处理提供了一个重要的数据管理...
相似文章
ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试
本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。
上下文优化下的检索增强生成:从梯度下降视角
本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。
视觉感知到概念的一阶规则学习网络 [R]
本文介绍了gammaILP,一个完全可微的框架,能够直接从图像数据中学习一阶规则,且无标签泄露,解决了符号接地和谓词发明等挑战。
丢失还是隐藏?监督持续学习中的概念级遗忘
本文介绍了一种基于稀疏自编码器(Sparse Autoencoders)的诊断框架,用于分析持续学习中的概念级遗忘,发现大部分遗忘源于表示不可访问性而非信息擦除。
基于混合态原型的量子增量学习
本文介绍了一种基于可训练混合态原型的量子增量学习框架,能够在无需增加电路宽度的前提下添加新类别,同时缓解灾难性遗忘。