LC-ICL:标签引导的对比上下文学习用于鲁棒信息抽取
摘要
本文提出LC-ICL,一种新颖的少样本技术,它同时使用正确和错误的示例以及错误原因标签,以提升大型语言模型在信息抽取任务(如命名实体识别和关系抽取)上的性能。
arXiv:2606.29407v1 公告类型:新
摘要:大型语言模型(LLM)在信息抽取(IE)领域,特别是命名实体识别(NER)和关系抽取(RE)任务中的应用日益受到关注。尽管研究人员正在探索通过上下文学习进行少样本信息抽取,但他们往往只关注使用正确或正面的示例作为演示,忽略了将错误或负面的示例纳入学习过程的潜在价值。在本文中,我们提出了LC-ICL,一种新颖的少样本技术,它利用正确和错误的样本构建来创建上下文学习演示。该方法通过结合带有错误原因标签的正面样本和负面样本,增强了LLM抽取实体和关系的能力。这些标签揭示了错误示例中更详细的错误特征,使模型能够理解相似预测失败的原因,并在推理过程中避免重复此类错误。具体而言,我们提出的方法利用了困难负面样本和测试样本最近正面邻居中的固有上下文信息和有价值信息,然后基于LLM应用上下文学习演示。我们在多个数据集上的实验表明,LC-ICL优于以往的少样本上下文学习方法,在广泛的相关任务中带来了显著的性能提升。这些改进值得注意,展示了我们方法在不同场景中的多功能性。
查看缓存全文
缓存时间: 2026/06/30 05:31
# LC-ICL: 标签引导的对比上下文学习用于鲁棒信息抽取
来源: https://arxiv.org/html/2606.29407
肖友¹, 闫天伟², 赵杉¹
¹合肥工业大学,合肥,中国
²重庆交通大学,重庆,中国
###### 摘要
近年来,利用先进大型语言模型 \(LLMs\) 在信息抽取 \(IE\) 领域(特别是命名实体识别 \(NER\) 和关系抽取 \(RE\) 任务)中的能力引起了越来越多的兴趣。尽管研究者们正在探索通过上下文学习使用 LLMs 进行少样本信息抽取,但他们往往只关注使用正确或正例样本进行演示,忽视了将错误或负例样本纳入学习过程的潜在价值。本文提出 **LC-ICL**,一种新颖的少样本技术,该方法同时利用正确和错误的样本构建来创建上下文学习示例。这种方法通过将正样本与带有错误原因标签的负样本相结合,增强了 LLMs 抽取实体和关系的能力。这些标签暴露了错误示例中更详细的错误特征,使模型能够理解类似预测为何失败,并在推理过程中避免重复此类错误。具体而言,我们提出的方法挖掘了硬负样本中固有的上下文信息和宝贵信息,以及测试样本最近的正确邻居,然后基于 LLMs 应用上下文学习示例。我们在多个数据集上的实验表明,**LC-ICL** 优于以往的少样本上下文学习方法,在广泛的相关任务中带来了显著的性能提升。这些改进值得注意,展示了我们方法在不同场景中的通用性。
## I. 引言
信息抽取 \(IE\) 是自然语言处理中的一项重要任务,旨在从纯文本中获取结构化知识。它可以应用于不同领域,例如知识图谱构建[54 (https://arxiv.org/html/2606.29407#bib.bib22)]和问答系统[2 (https://arxiv.org/html/2606.29407#bib.bib23)]。随着大型语言模型 \(LLMs\)[3 (https://arxiv.org/html/2606.29407#bib.bib24),28 (https://arxiv.org/html/2606.29407#bib.bib36),39 (https://arxiv.org/html/2606.29407#bib.bib38),1 (https://arxiv.org/html/2606.29407#bib.bib39)]的兴起,IE 取得了显著进展[16 (https://arxiv.org/html/2606.29407#bib.bib40),48 (https://arxiv.org/html/2606.29407#bib.bib41)]。近年来,少样本 IE 的研究重点已从传统的监督微调方法转向利用 LLMs 进行上下文学习 \(ICL\) 示例[4 (https://arxiv.org/html/2606.29407#bib.bib46),25 (https://arxiv.org/html/2606.29407#bib.bib47)]。

图 1:以关系抽取 \(RE\) 任务为例,该图说明了 **LC-ICL** 的核心机制。在进行直接推理时,大型模型容易产生大量带有特定模式的错误。**LC-ICL** 引入了一种错误标注系统,将错误类型反馈给模型,引导其优化生成,从而显著减少错误并提高推理准确率。
以往的研究[47 (https://arxiv.org/html/2606.29407#bib.bib44),4 (https://arxiv.org/html/2606.29407#bib.bib46),26 (https://arxiv.org/html/2606.29407#bib.bib49),40 (https://arxiv.org/html/2606.29407#bib.bib50)]探索了使用自然语言提示或上下文学习 \(ICL\) 示例来引导 LLMs 在少样本设置下标注测试数据,有时需要额外的预训练或微调步骤。为了更好地适应信息抽取任务的结构化性质,更近期的方法[17 (https://arxiv.org/html/2606.29407#bib.bib48),35 (https://arxiv.org/html/2606.29407#bib.bib51),44 (https://arxiv.org/html/2606.29407#bib.bib45),45 (https://arxiv.org/html/2606.29407#bib.bib57),42 (https://arxiv.org/html/2606.29407#bib.bib54)]采用类似代码或结构化的提示来增强预训练与推理之间的一致性。然而,这些方法尚未完全释放 LLMs 的潜力,部分原因是模型依赖于有限的正例数据,无法从自身的错误中学习。为了解决这个问题,本文提出了一种对比上下文学习方法,该方法利用正例和负例来扩展 LLMs 的学习过程,从而使模型暴露于更广泛的场景,包括典型错误。该方法旨在于挖掘常被忽略的负例数据的价值,从而实现更全面、更鲁棒的信息抽取能力。假设模型已经从中学习到了任务执行和问题解决模式,但其预测中仍然存在错误。在这种情况下,模型应该反思这些错误的原因,对错误类型进行分类,并尝试在后续推理中避免它们。因此,引入与负样本相关的信息有助于解决这个问题。受这一想法的启发,本文将正确/正例和错误/负例都整合到 ICL 示例中,以提升上下文学习的信息抽取性能。具体而言,我们首先使用大规模模型对标注数据生成标签,以选择硬负样本。然后,我们从训练数据中为当前测试实例选择语义相似的正样本,并使用不同的模型(自然语言 LLMs 或代码 LLMs)设计最合适的上下文示例。在包含更丰富知识的错误/负样本选择模块中,我们采用基于语义相似性感知的检索方法进行排序。为了展示所提方法的优势,我们在三个命名实体识别 \(NER\) 和五个关系抽取 \(RE\) 基准数据集上进行了实验,随后对该方法带来的好处进行了深入分析。本文的主要贡献总结如下:
- • 我们提出了 **LC-ICL**,一种对比上下文学习方法,其中包含正例示例以及带有错误原因标签的负样本。这些带有标签的负样本提供了更详细的错误特征,帮助 LLMs 识别失败模式,并在信息抽取过程中避免类似错误。
- • 我们设计了一种有效的检索策略来选择硬负样本作为上下文学习的一部分,利用它们进一步增强信息抽取能力。
- • 我们在基准数据集上进行了大量实验,证明了所提方法在 NER 和 RE 任务中的有效性和广泛适用性。
## II. 任务定义
给定一个包含 \(l\) 个标记 \(x_1, x_2, \cdots, x_l\) 的句子 \(X\),IE 任务的目标是从 \(x\) 中预测结构化输出 \(Y\)(命名实体或关系)。在 NER 任务中,目标 \(Y\) 是带有实体类型 \(E\) 的实体跨度 \((e, t) \mid x_i, \dots, x_j\),其中 \(e\) 是序列中的一个实体,\(t\) 是来自预定义实体类型集合 \(\mathcal{T}\)(例如,LOC, PER, ORG)的实体类型。在 RE 任务中,目标 \(Y\) 是一组实体之间的关系,通常表示为三元组 \((e_1, r, e_2)\)。这不仅涉及预测关系 \(r \in \mathcal{R}\),还包括实体 \(e_1\) 和 \(e_2\) 的类型 \(t_1\) 和 \(t_2\),其中 \(\mathcal{R}\) 表示关系类型(例如,Work For, Live In, Located In)。实体 \(e_1\) 和 \(e_2\) 的类型也需要预测,其中 \(t \in \mathcal{T}\) 表示实体类型。我们将 IE 建模为生成任务,提示大型语言模型执行 NER 或 RE 的推理。在少样本上下文学习设置下进行信息抽取时,示例被组织成四个部分:(1) 负例,(2) 正例,(3) 指令,以及 (4) 测试文本。LLMs 的输出是一个元组列表,在 NER 任务中为 \([(e_1, t_1), \dots, (e_j, t_j)]\),例如 \([('Steve', 'person')]\)。

图 2:该图展示了用于信息抽取任务的 **LC-ICL** 框架概览,以命名实体识别 \(NER\) 任务为例。该方法构建正例和负例,连同测试样本和任务指令一起输入大型语言模型以生成预测。步骤 1–4 表示基于检索示例获取带标签负样本的过程。
## III. LC-ICL
### III-A 模型概述
如图 2 (https://arxiv.org/html/2606.29407#S2.F2) 所示,在上下文示例中,我们的方法主要包括 4 个部分:指令部分、测试句子部分、正样本部分和负样本部分。与先前仅依赖正样本进行上下文学习的方法不同,我们的方法 **LC-ICL** 同时利用正例和带有显式推理错误标注的负例。对于正样本的选择,我们采用不同的检索策略从训练集中选择与测试示例对应的样本。对于负样本的选择,我们首先从每个数据集的训练数据中采样一个子集以形成负样本集合。然后,\(M_{\mathrm{infer}}\) 对负样本集合中的数据生成预测,\(M_{\mathrm{label}}\) 将每个预测与其黄金标签进行比较以分配错误标签,形成最终的负样本池。最后,我们还使用不同的检索策略从负样本池中检索出与测试样本对应的一个负样本。结合之前选择的正样本,我们同时使用正样本和负样本作为 ICL 的示例提供给大型模型。大型模型将从正例中学习正确模式,从而提高准确率,而带有错误标签的负样本将告知模型类似的错误模式,帮助其避免类似错误并降低错误率。
### III-B LC-ICL 示例构建
我们为每个给定的测试句子构建一个提示,并将其输入 LLM。每个提示包含以下组成部分:
**测试句子 \(X_t\)**: 表示 RE/NER 测试样本的原始文本,用于最终评估大型模型在指定方法下执行 RE/NER 任务的性能。
**指令 \(\mathcal{I}\)**: 我们根据不同的任务将大型模型约束为不同的专家角色,并根据任务差异提供关系集合 \(\mathcal{R}\) 或实体类型集合 \(\mathcal{T}\)。我们使用简洁的命令要求大型模型完成 RE/NER 任务,并要求其以固定列表格式返回响应。该指令进一步引导模型关注带有错误原因标签的负样本,以便模型能够从错误示例中获取细粒度的错误特征信号,并在测试句子上避免类似的错误。
**正样本 \(\mathcal{P}\)**: 参考先前的工作[17 (https://arxiv.org/html/2606.29407#bib.bib48)],我们使用 KNN 算法(k 近邻算法)从训练集中选择与测试样本 \(X_t\) 在嵌入空间中具有最高语义相似度的示例,作为正样本 \(\mathcal{P}\)。
**负样本 \(\mathcal{N}\)**: 设 \(M_{\mathrm{infer}}\) 表示产生预测的推理模型,\(M_{\mathrm{label}}\) 表示通过将每个预测与其黄金标签进行比较来分配错误标签的标签构建模型。
\[
\mathcal{X}'_{\mathrm{pred}} = M_{\mathrm{infer}}(\mathcal{I}, \mathcal{X}'_t) \qquad (1)
\]
\[
\mathcal{N}_{\mathrm{label}} = M_{\mathrm{label}}(\mathcal{I}, E, \mathcal{X}'_t, \mathcal{X}'_{\mathrm{pred}}, \mathcal{X}'_g) \qquad (2)
\]
\[
\mathcal{N} = \{ (\mathcal{X}'_t, \mathcal{X}'_{\mathrm{pred}}, \mathcal{X}'_g, \mathcal{N}_{\mathrm{label}}) \} \qquad (3)
\]
遵循先前工作中的方法[17 (https://arxiv.org/html/2606.29407#bib.bib48)],我们首先从训练集中采样 2500 个带标签的样本,并使用 \(M_{\mathrm{infer}}\) 对这些样本生成预测,如公式 1 (https://arxiv.org/html/2606.29407#S3.E1) 所示。这里,\(\mathcal{X}'_t\) 表示采样的输入示例,\(\mathcal{X}'_g\) 表示它们对应的黄金标签,\(\mathcal{X}'_{\mathrm{pred}}\) 表示 \(M_{\mathrm{infer}}\) 产生的预测。接下来,我们将输入示例、预测和黄金标签提供给 \(M_{\mathrm{label}}\),以用错误标签标注错误的预测,如公式 2 (https://arxiv.org/html/2606.29407#S3.E2) 所示。这里,\(E\) 表示错误标签集合,\(\mathcal{N}_{\mathrm{label}}\) 表示生成的错误标签集合。最后,使用与筛选正样本相同的方法,我们采用 KNN 算法选择与测试样本对应的负样本,并将 \(\mathcal{X}'_t, \mathcal{X}'_{\mathrm{pred}}, \mathcal{X}'_g\) 和 \(\mathcal{N}_{\mathrm{label}}\) 一起存储在负样本池中,如公式 3 (https://arxiv.org/html/2606.29407#S3.E3) 所示。
\[
Y_t = M_{\mathrm{infer}}(\mathcal{P}, \mathcal{N}, \mathcal{I}, X_t) \qquad (4)
\]
总的来说,我们提出的框架的输入和输出可以用公式 4 (https://arxiv.org/html/2606.29407#S3.E4) 表示,其中 \(Y_t\) 表示 \(M_{\mathrm{infer}}\) 对测试样本 \(X_t\) 产生的推理结果。
\[
E_{\mathrm{RE}} = \{ E_1, E_2, E_3, E_4, E_5, E_6 \} \qquad (5)
\]
\[
E_{\mathrm{NER}} = \{ E'_1, E'_2, E'_3, E'_4, E'_5 \} \qquad (6)
\]
\[
E_{\mathrm{RE}} \cup E_{\mathrm{NER}} \subseteq E \qquad (7)
\]
我们仔细分析了推理错误的原因,并为 RE 和 NER 任务分别制定了详细的错误标签。RE 中的错误被分为 6 类,如公式 5 (https://arxiv.org/html/2606.29407#S3.E5) 所示,而 NER 中的错误被分为 5 类,如公式 6 (https://arxiv.org/html/2606.29407#S3.E6) 所示。在公式 7 (https://arxiv.org/html/2606.29407#S3.E7) 中,\(E_{\mathrm{RE}}\) 和 \(E_{\mathrm{NER}}\) 共同构成 \(E\)。公式 5 (https://arxiv.org/html/2606.29407#S3.E5) 和公式 6 (https://arxiv.org/html/2606.29407#S3.E6) 中具体的标签类型及其含义可在附录 B (https://arxiv.org/html/2606.29407#A2) 中找到。
### III-C LC-ICL 检索策略
#### III-C1 基于 KNN 的检索
在少样本学习中,选择与测试样本语义相似的示例至关重要 [21 (https://arxiv.org/html/2606.29407#bib.bib58)]。研究表明,使用 KNN 方法从训练集中检索最相似的示例可以提高模型性能 [14 (https://arxiv.org/html/2606.29407#bib.bib59),21 (https://arxiv.org/html/2606.29407#bib.bib58),12 (https://arxiv.org/相似文章
多样本思维链上下文学习:让上下文学习真正学会
本文研究了推理任务的多样本思维链上下文学习,揭示了标准扩展规则并不适用,并提出了Curvilinear Demonstration Selection (CDS)方法以改进示例排序,最高可获得5.42个百分点的性能提升。
BCL:面向信息抽取的贝叶斯上下文学习框架
BCL是首个采用带有贝叶斯更新的粒子滤波来系统优化信息抽取任务中标签表示的框架,相较于现有方法展现出持续一致的改进。
AbICL:面向抗原特异性抗体亲和力排序的上下文学习
AbICL提出了一种面向抗原特异性抗体亲和力排序的上下文学习框架,将预训练的结构编码器与上下文排序头相结合,利用带标签的演示进行测试时自适应,无需梯度更新。
MAG:流形引导的半监督多模态上下文学习
本文介绍了MAG,一种流形引导的半监督多模态上下文示例选择框架,利用未标记数据改进多模态大语言模型的少样本上下文学习。在八个基准上的实验表明,在标签稀缺场景下取得了一致的性能提升。
ICA Lens:无需训练另一个字典即可解读语言模型
ICA Lens 重新引入独立成分分析作为解读语言模型表示的高效方法,提供了一种比稀疏自编码器训练更快的替代方案,同时保持有竞争力的性能。