FSE:基于快慢专家的命名实体识别持续学习

arXiv cs.CL 论文

摘要

提出FSE,一种基于快慢专家(Fast-Slow Experts)的跨度NER模型用于持续学习,在CLNER基准上达到最先进性能。

arXiv:2607.22075v1 公告类型:新 摘要:命名实体识别持续学习(CLNER)使模型能够逐步学习新实体类型而不会遗忘先前学到的类型。然而,现有方法存在灾难性遗忘和对跨任务共享信息利用不足的问题。本文提出FSE,一种基于快慢专家增强的跨度NER模型用于CLNER。共享的快速专家学习词级链接以高效过滤掉不可能的跨度,而特定任务的慢速专家仅对剩余候选项进行跨度分类。它通过促进跨任务的知识共享来稳定学习,并通过减少每个任务的学习负担来保持可塑性。还引入了一种长度衰减负采样策略以缓解跨度不平衡。在OntoNotes和FewNERD合成数据集上的大量实验表明,FSE在CLNER场景中达到了最先进性能,验证了每个组件的有效性、更快的收敛经验证据以及两种专家的预期功能。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:40

# FSE: 通过快慢专家实现命名实体识别的持续学习
来源:https://arxiv.org/html/2607.22075
###### 摘要

持续学习命名实体识别(CLNER)使模型能够逐步学习新的实体类型,而不会遗忘先前学到的实体类型。然而,现有方法存在灾难性遗忘以及对跨任务共享信息利用不足的问题。本文提出了FSE,一种由快慢专家增强的基于跨度(span)的NER模型,用于CLNER。共享的快速专家学习词元级别的链接,以高效过滤掉不可能的跨度,而任务特定的慢速专家仅对剩余候选跨度进行跨度分类。该方法通过促进跨任务的知识共享来稳定学习,并通过减轻每个任务的学习负担来保持可塑性。我们还引入了一种长度衰减负采样策略,以缓解跨度不平衡问题。在OntoNotes和FewNERD合成数据集上进行的大量实验表明,FSE在CLNER场景中达到了最先进的性能,验证了各组件的有效性、更快的收敛速度以及两个专家的预期功能。

###### 关键词:

持续学习,命名实体识别,快慢专家

††期刊:Pattern Recognition Letters\\affiliation

\[label1\]organization=哈尔滨工业大学计算机科学与技术学院, 城市=深圳, 省=广东, 国家=中国

## 1 引言

持续学习对于推进可进化的人工通用智能至关重要,它使模型能够从流数据中获取新知识[1 (https://arxiv.org/html/2607.22075#bib.bib1)]。在该领域,命名实体识别持续学习(CLNER)是开发需要动态适应变化场景的实时或个人应用的关键。NER旨在从非结构化文本中提取实体,而CLNER进一步支持随着时间的推移增量学习新的实体类型,同时不遗忘先前学到的实体类型[2 (https://arxiv.org/html/2607.22075#bib.bib2)]。例如,在通过医学文本训练学会检测医学术语后,模型仍然能准确识别先前学过的实体类型(如人物和地点),而无需从头开始重新训练。

CLNER经常遭遇灾难性遗忘[3 (https://arxiv.org/html/2607.22075#bib.bib3),4 (https://arxiv.org/html/2607.22075#bib.bib4)],即在新任务上训练的模型往往会迅速破坏先前学到的任务。为了缓解这一问题,标准NER模型通常会加入反遗忘技术,例如知识蒸馏或模型扩展。同时,这些努力也见证了NER从序列标注到基于跨度方法的范式转变[5 (https://arxiv.org/html/2607.22075#bib.bib5)]。这里我们聚焦于基于跨度的方法,该方法枚举并分类所有可能的文本跨度,提供更丰富的表示,并且通常能带来更优的性能。值得注意的是,近期的大型语言模型(LLM)因其强大的泛化能力在CLNER中显示出潜力。然而,实证研究[6 (https://arxiv.org/html/2607.22075#bib.bib6)]表明,LLM的表现仍然不及它们更小、专用于NER的基于BERT的对应模型。此外,巨大的计算需求和动态更新大量参数的挑战也阻碍了其实际部署。

参照图注图1:与在传统方法中学习海量跨度相比,FSE中的快速专家高效地学习少量链接以过滤掉大部分跨度,这减轻了最终检测实体的慢速专家的学习负担。因此,基于跨度的CLNER方法仍然是首选,但我们认为仍然存在两个方面的未解决挑战:1) 首先,**任务干扰**可能导致持续学习期间参数更新冲突。因此,能够显式建模任务共享信息的模型有助于促进这一过程中的稳定性。然而,现有的基于跨度的方法仅共享BERT基础编码器,未能探索可在不同任务之间共享的、NER特有的额外高层信息。例如,当跨度文本"[PER] at"(一个表示人物的实体但后跟介词)已在先前任务中被学习为非实体跨度时,这种模式在后续任务中也不太可能是实体。这类知识是可以共享的。2) 其次,随着学习的进行,模型的可塑性逐渐减弱[7 (https://arxiv.org/html/2607.22075#bib.bib7)],使得获取新实体类型变得越来越困难。因此,为每个任务减轻学习负担将有利于持续学习。例如,对于当前学到的非实体跨度"[PER] at",模型应该能够轻松地将扩展跨度"[PER] at the"也识别为非实体。

这里我们提出,合适设计的相邻词元之间的"链接"可以同时解决这两个问题。具体来说,我们引入了一种由快慢专家增强的基于跨度的模型(FSE),其中快速专家(跨任务共享)对这些链接进行建模,而慢速专家(任务特定)在每个任务上执行标准的跨度分类。如图1 (https://arxiv.org/html/2607.22075#S1.F1)所示,给定一个包含n个词元的句子,传统的基于跨度的方法需要费力地枚举所有0.5\(n^2 - n\)个跨度来检测每个任务中的实体。相反,我们的快速专家首先学习相对较少的(n-1个)相邻词元之间的链接。我们定义:实体跨度内的链接全部为强链接,而非实体跨度必须至少包含一个弱链接。值得注意的是,这种链接机制只是施加在模型上的一种归纳偏置,具体的链接强度仍然由模型在训练过程中自动学习。基于此设计,我们期望一旦快速专家学会了一个弱链接(例如,在"[PER] at"之间),大量覆盖该链接的跨度可以迅速被过滤掉。然后,剩余的少数跨度将由慢速专家重点处理。这大大减轻了慢速专家的跨度学习负担,并且快速专家的可共享机制也有利于后续任务中新加入的慢速专家。

在实现中,双专家被联合优化以避免错误传播。首先,快速专家应用softmin池化将某个跨度内学到的链接分数聚合成该跨度的"快速分数",确保如果检测到任何弱链接,该跨度的级别快速分数倾向于较低。接着,快速分数与慢速专家的输出分数对每个跨度进行融合,确保只有当快速专家自信地识别出强链接且慢速专家将其确认为有效实体时,一个实体才被识别。不满足这两个条件的跨度将被拒绝。在持续学习过程中,我们使用知识蒸馏来蒸馏先前任务中双专家的融合输出,以传递先验知识。此外,得益于快速专家在过滤跨度方面的效率,需要显式学习的负跨度更少。这使得负采样(一种旨在缓解基于跨度模型中固有的正负跨度不平衡的技术)特别适用。我们提出一种基于长度衰减的负采样策略,根据跨度长度调整采样概率,并将其应用于当前任务学习和旧任务蒸馏。

在从OntoNotes和FewNERD合成的数据集上进行的大量实验表明,FSE的有效性,在包括LLM方法在内的各种基线中达到了最先进的性能。本文的贡献包括:

- •我们识别了相邻词元链接在促进基于跨度的CNLER模型稳定性和可塑性方面的潜力。
- •我们引入了联合优化的快慢专家来增强标准的基于跨度的CLNER模型,其中快速专家利用链接来指导慢速专家的跨度建模。这降低了任务特定的学习难度,同时实现了有效的任务间知识共享。
- •包括基于LLM的竞争对手在内的大量实验证明了我们的FSE在CLNER场景中的优越性能。

## 2 相关工作

**命名实体识别**是自然语言处理(NLP)中信息抽取的基石,旨在从非结构化文本中识别预定义的实体类型。NER传统上被形式化为序列标注,通过在神经表示之后采用CRF[8 (https://arxiv.org/html/2607.22075#bib.bib8),9 (https://arxiv.org/html/2607.22075#bib.bib9)]。相比之下,基于跨度的方法枚举文本中所有可能的跨度并直接进行分类,无需BIO(开始-内部-外部)标注方案转换,并能处理嵌套实体[10 (https://arxiv.org/html/2607.22075#bib.bib10),11 (https://arxiv.org/html/2607.22075#bib.bib11)]。此外,基于机器阅读理解(MRC)的方法使用指针网络在输入文本中定位实体位置[12 (https://arxiv.org/html/2607.22075#bib.bib12),13 (https://arxiv.org/html/2607.22075#bib.bib13)]。除了这些基于抽取的范式,基于生成的方法(如基于Seq2Seq的)直接从给定输入生成实体提及[14 (https://arxiv.org/html/2607.22075#bib.bib14),15 (https://arxiv.org/html/2607.22075#bib.bib15)]。近期的基于LLM的NER方法也是生成式的,在处理已见和未见实体类型方面展现出显著的泛化能力。然而,较小的模型由于其效率和领域特定适应性仍然具有价值。

**持续学习NER**处理新实体类型顺序出现的演进场景。这种数据分布的渐进变化违反了独立同分布(i.i.d.)假设,导致对先前学到的实体类型的灾难性遗忘。CLNER旨在平衡对过去学习的保留与新信息的获取,也称为稳定性-可塑性困境。Monaikul[2 (https://arxiv.org/html/2607.22075#bib.bib2)]首次将CLNER框架定义为类增量持续学习,并引入了基于序列标注的AddNER和ExtendNER。每个顺序任务的训练数据仅标注当前正在学习的实体类型,模型在需要预测所有累积学到的实体类型的数据上进行评估。AddNER为每个新任务使用独立的头部,而ExtendNER使用跨所有任务共享的单个统一头部,两者都结合了知识蒸馏。随后,L&R[16 (https://arxiv.org/html/2607.22075#bib.bib16)]和ExtendNER+DLD[17 (https://arxiv.org/html/2607.22075#bib.bib17)]都基于ExtendNER进一步提高了其性能。SpanKL[11 (https://arxiv.org/html/2607.22075#bib.bib11)]首次在CLNER中使用基于跨度的建模和二元分类,以缓解不同任务中非实体类型之间的冲突。SKD-NER[18 (https://arxiv.org/html/2607.22075#bib.bib18)]在此基础上进一步使用强化学习。然而,所有这些方法仅通过底层的BERT参数共享信息,忽略了利用跨任务共享的其他类型信息的潜力。相比之下,在诸如持续语义分割等计算机视觉任务中,架构分解方法探索将模型分解为任务特定和任务共享组件,其中任务共享部分支持同时调和旧知识和新知识,而任务特定部分则适应新任务[19 (https://arxiv.org/html/2607.22075#bib.bib19)]。例如,表示补偿网络[20 (https://arxiv.org/html/2607.22075#bib.bib20)]使用结构重参数化将CNN模块解耦为两个并行分支,分别处理共享信息和任务特定信息。LAG[21 (https://arxiv.org/html/2607.22075#bib.bib21)]在通道级和空间级上解耦语义特征,以同时协调知识继承和新任务学习,其中语义不变知识被建模为跨任务共享的抽象原型。据我们所知,我们是第一个在持续学习(CL)设置下探索NER特定的可共享信息(尤其是基于跨度的方法)以提升跨任务整体性能的工作。

参照图注图2:FSE示意图:用于链接建模的任务共享快速专家输出快速分数。用于跨度建模的任务特定慢速专家输出跨度分数。两个分数最终融合。先前任务和当前任务分别通过KL损失和BCE损失进行优化。负采样应用于两种优化中。

## 3 方法

在本节中,我们首先形式化CLNER,然后介绍FSE的基础架构,包括慢速专家、快速专家及其协作机制。最后,描述所使用的训练技术。

### 3.1 CLNER形式化定义

CLNER正式定义如下:一个NER模型在任务流T1, T2, ..., TL上顺序训练。每个任务Tl引入一组新的实体类型El = {el^1, el^2, ...}。任务Tl的数据集仅标注其对应的实体类型El。通常,在训练任务Tl期间,模型无法访问先前任务T1, ..., T(l-1)的数据。

学习过程从在T1上训练初始模型M1以识别E1中的实体类型开始。对于后续的每个步骤l > 1,模型Ml基于M(l-1)在任务Tl的数据上进行增量训练,旨在识别所有先前学到的实体类型⋃_{i=1}^l Ei。

### 3.2 模型架构

图2 (https://arxiv.org/html/2607.22075#S2.F2)展示了FSE的整体架构,包括用于词元学习的上下文编码器、用于链接学习的任务共享快速专家和用于跨度学习的任务特定慢速专家。负采样应用于KL和BCE两种优化中。

#### 3.2.1 上下文编码器

给定输入句子X,包含n个词元[x_1, x_2, ..., x_n],我们将跨度s_{ij}定义为从x_i到x_j的连续词元,其中1 ≤ i ≤ j ≤ n。上下文编码器捕获词元依赖关系,并为每个词元生成上下文表示。我们采用广泛使用的基于BERT的预训练语言模型作为上下文编码器,公式如下:

H = Encoder(X)  (1)

其中H = [h_1, h_2, ..., h_n] ∈ R^{n×d_h} 表示每个词元的上下文表示向量,d_h是隐藏层大小。

#### 3.2.2 慢速专家

慢速专家对每个跨度的表示进行建模,以促进跨度分类。我们遵循SpanKL,使用词元"起始"和"结束"特征空间之间的简单缩放点积交互。这意味着慢速专家具有边界意识,负责检测跨度边界,从而使快速专家能够专注于跨度内的信息。具体地,对于每个实体类型,我们使用两个不同的单层前馈网络(FFN)来分别生成词元的起始和结束表示。然后,跨度表示h^{s_{ij}}计算如下:

h^{s_{ij}} = [h^{s_{ij}}_1, h^{s_{ij}}_2, ..., h^{s_{ij}}_K] ∈ R^K  (2)

相似文章

SEAL: 智能体与学习环境的协同共演化

arXiv cs.CL

SEAL提出了一个闭环框架,用于联合演化LLM智能体及其训练环境,利用诊断引导的标签对齐双方。仅用400个训练样本,它就在多轮工具使用任务上取得了显著提升,表现出更好的鲁棒性和分布外迁移能力。