通过两步验证增强生成式信息提取:产品属性用例

arXiv cs.CL 论文

摘要

本文提出了一种用于生成式信息提取的两步验证方法,将PLM模块集成到流程中,以增强LLM的性能,特别是在数字产品护照的产品属性提取中处理弱表达实体方面。

arXiv:2607.26780v1 公告类型:新 摘要:大语言模型(LLMs)处理和生成文本的能力为信息提取(IE)应用带来了潜力。虽然关于LLMs在分类任务中是否优于较小的微调模型存在争议,但它们强大的泛化能力使其在可用于微调的标注数据有限的领域中具有前景。这一优势尤其适用于数字产品护照(DPP)这一新兴应用,其问题空间广泛但领域特定数据仍然稀缺。受此用例启发,我们将生成式IE应用于产品领域,明确解决效率、泛化性和数据隐私约束。我们提出了一种两步验证方法,将PLM模块集成到生成式IE流程中,从而利用LLMs的纠正能力。我们发现,这种验证任务增强了LLM的性能,特别是在提取文本中稀疏出现的弱表达、低显著性实体方面。对于某些实体,中等规模模型的性能甚至可以接近较大模型,并且第一步PLM预测的改进也提升了最终的LLM输出。然而,对最小的开源LLMs(例如 Llama-3.2 3B)的影响有限。基于这些发现,我们开发了一个用于产品信息提取的演示应用程序,该程序利用本地部署的LLMs,旨在进一步适应真实世界的DPP用例。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# 基于两步验证增强生成式信息抽取:产品属性用例
来源:https://arxiv.org/html/2607.26780
Yi\-Sheng Hsu Nermeen Abou Baker Uwe Handmann 计算机科学研究所,鲁尔西部应用科学大学 博特罗普,德国 \{firstname\.lastname\}@hs\-ruhrwest\.de

###### 摘要

大型语言模型(LLMs)处理及生成文本的能力为信息抽取(IE)应用带来了潜力。尽管 LLMs 在分类任务上是否优于经过微调的较小模型尚有争议,但其强大的泛化能力使其成为标记数据有限领域的理想选择。这一优势对于数字产品护照(DPP)这一新兴应用尤为突出,该领域问题空间广阔但领域特定数据稀缺。受此用例驱动,我们将生成式 IE 应用于产品领域,明确应对效率、泛化能力和数据隐私约束。我们提出一种两步验证方法,将 PLM 模块集成到生成式 IE 流水线中,从而利用 LLMs 的校正能力。我们发现,这种验证任务能够提升 LLM 的性能,尤其是在提取文本中稀疏出现的、表达不明确的低显著性实体方面。对于某些实体,中等规模模型的性能甚至可以达到与较大模型相当的水平,且第一步 PLM 预测的改进也提升了最终 LLM 的输出质量。然而,对于最小的开源 LLMs(如 Llama\-3.2 3B),效果有限。基于这些发现,我们开发了一个产品信息抽取演示应用,该应用使用本地部署的 LLMs,旨在进一步适配实际 DPP 用例。¹¹¹实验代码仓库:https://github.com/doyouwantsometea/pie_paper。演示应用:https://github.com/hrw-neurolab/transferhub_pie_demo。

增强生成式信息抽取的两步验证:产品属性用例

Yi\-Sheng Hsu Nermeen Abou Baker Uwe Handmann 计算机科学研究所,鲁尔西部应用科学大学 博特罗普,德国 \{firstname\.lastname\}@hs\-ruhrwest\.de

## 1 引言

作为一项历史悠久的自然语言处理任务,信息抽取(IE)由于信息来源和任务需求的多样性与不断变化,至今仍然充满挑战(Xu et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib7))。早期工作通过微调预训练语言模型(PLMs)如 BERT 来执行 IE(Jiang et al., 2020 (https://arxiv.org/html/2607.26780#bib.bib30); Shin et al., 2020 (https://arxiv.org/html/2607.26780#bib.bib29)),而近期研究则尝试利用 LLMs 的生成能力直接输出结构化数据(Zhang et al., 2025 (https://arxiv.org/html/2607.26780#bib.bib9))。两种主流方法各有优劣:微调后的 PLMs 由于任务的分类导向性,通常能超越 LLMs 的性能(Wang et al., 2025 (https://arxiv.org/html/2607.26780#bib.bib6))。相比之下,LLMs 对领域特定数据的依赖较少,在训练数据稀缺时泛化能力优于 PLMs。在实际应用中,这种权衡往往给部署既有效又与领域知识良好集成的鲁棒 IE 应用带来挑战(Ma et al., 2023 (https://arxiv.org/html/2607.26780#bib.bib14); Blume et al., 2023 (https://arxiv.org/html/2607.26780#bib.bib34); Kim et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib36))。

参照图注图 1:两步验证任务的工作流程,其中 LLMs 被指示修正 PLM 的输出,而非直接从文本中抽取信息。此挑战与产品领域尤其相关(Schön et al., 2018 (https://arxiv.org/html/2607.26780#bib.bib33); Brinkmann et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib1); Hätty et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib35)):结构化、领域特定的标注成本高昂且数量有限,而产品信息高度异构,且经常受保密限制。这些挑战将我们的注意力引向该领域,尤其是在欧盟委员会数字产品护照(DPP)的背景下(Petrik et al., 2025 (https://arxiv.org/html/2607.26780#bib.bib32)),该护照要求结构化披露产品属性,包括材料、组件和制造细节。DPP 的实施计划于 2027 年开始,首先从电池开始,逐步覆盖更广泛的范围。虽然 DPP 的建立可以从 IE 应用中受益,以创建和处理所需的结构化数据,但数据的缺失和广泛的范围给处理此类用例带来了瓶颈。此外,在处理产品规格或机密信息时,企业出于数据隐私考虑,往往避免使用商业 LLMs(例如 ChatGPT 或 Gemini),这阻碍了这些新法规所要求的结构化数据的生成和使用。

受 DPP 用例的驱动,本研究中我们专注于使用开源 LLMs 进行产品信息提取,并最终构建一个演示应用,以便进一步扩展到更广泛的用例。为了在减少模型大小以实现本地部署的同时,增强跨未充分探索产品领域的泛化能力,我们将传统的生成式 IE 方法重新表述为验证任务,并指示 LLMs 纠正来自微调 PLM 的第一步预测(图 1 (https://arxiv.org/html/2607.26780#S1.F1))。这一转变策略性地利用了 LLMs 的文本精炼优势,在不增加模型大小的情况下提升输出质量,从而实现更高效的性能-尺寸比。我们的研究贡献如下:

- • 我们引入了一种混合的两步生成式 IE 方法,通过将 PLM 模块集成到生成式 IE 流水线中,提出了验证任务。
- • 我们的方法尤其提升了在低显著性、表达不明确的实体类别上的生成式 IE 性能。这使得较小的 LLMs 能够提供与较大模型相当的性能,从而有利于本地部署和数据隐私。
- • 基于所提出的验证任务重构,我们原型实现了一个演示应用(§5 (https://arxiv.org/html/2607.26780#S5)),该应用可以进一步集成到实际应用中,尤其是在 DPP 的背景下。

实体AmazonE\-commerceSize570349Weight90771Product number710133Component993718Material637400Manufacturer722447数据实例426512表 1:数据集大小、实体类别及其在每个数据集中的计数。前三个实体更明确,而后面的实体在文本中表达较弱,因此被认为更具挑战性。
## 2 相关工作

#### 传统与生成式 IE。

信息抽取(IE)将纯文本转化为结构化信息,通常分为命名实体识别(NER)、关系抽取(RE)和事件抽取(EE)(Lu et al., 2022 (https://arxiv.org/html/2607.26780#bib.bib12); Xu et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib7))。NER 的传统方法包括 BiLSTM\-CRF(Lample et al., 2016 (https://arxiv.org/html/2607.26780#bib.bib19))以及随后的 PLMs 如 BERT(Devlin et al., 2019 (https://arxiv.org/html/2607.26780#bib.bib21))和 RoBERTa(Liu et al., 2019 (https://arxiv.org/html/2607.26780#bib.bib20));随着 LLMs 的最新发展,它们的广泛使用使任务从原有的分类导向转变为生成导向(Hsu and Roberts, 2024 (https://arxiv.org/html/2607.26780#bib.bib4); Xu et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib7); Zhang et al., 2025 (https://arxiv.org/html/2607.26780#bib.bib9))。

然而,LLMs 的生成能力是否足以应对 IE 任务仍是一个有争议的话题。LLMs 在 IE 任务上通常不如微调的 PLMs(Gao et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib17); Peng et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib18))。多项研究强调了 PLMs 和 LLMs 之间仍存在的显著差距(Han et al., 2023 (https://arxiv.org/html/2607.26780#bib.bib3); Li et al., 2023 (https://arxiv.org/html/2607.26780#bib.bib11); Chen et al., 2024a (https://arxiv.org/html/2607.26780#bib.bib15); Liao et al., 2025 (https://arxiv.org/html/2607.26780#bib.bib16));LLMs 在少样本 IE 上被认为不够充分,其性能可能因幻觉或跨度边界不匹配而在简单样本上变得更差(Ma et al., 2023 (https://arxiv.org/html/2607.26780#bib.bib14))。Han et al. (2023 (https://arxiv.org/html/2607.26780#bib.bib3)) 强调了 LLMs 的现有挑战,例如扩展跨度长度和对无关上下文过度敏感。根据 Wang et al. (2025 (https://arxiv.org/html/2607.26780#bib.bib6)) 的研究,未经微调的 LLMs 在 NER 任务上往往落后于有监督的基于 BERT 的模型,并可能进一步遭受已知挑战,如幻觉。

#### 性能提升。

以往的研究探索了多种提高生成式 IE 性能的方法。通常,LLMs 能够修改自身生成的输出以获得更好的结果(Madaan et al., 2023 (https://arxiv.org/html/2607.26780#bib.bib28); Kamoie et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib39))。在 IE 任务中,使用少于 1000 个数据实例进行微调可以提升性能(Dunn et al., 2022 (https://arxiv.org/html/2607.26780#bib.bib2)),而 LLMs 在提供自我标注的实体时也能在 NER 中改进(Xie et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib5))。此外,修改输出结构(Sainz et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib25)),例如应用代码风格表述(Li et al., 2025a (https://arxiv.org/html/2607.26780#bib.bib24)),也被发现有益。

LLMs 也经常作为 IE 工作流的一个组件来获得更好的整体性能。Wei et al. (2023 (https://arxiv.org/html/2607.26780#bib.bib8)) 提出了一种两步 QA 流程,以进一步分解零样本 IE 任务。类似地,Li et al. (2024 (https://arxiv.org/html/2607.26780#bib.bib13)) 将 NER 任务拆分为识别命名实体和格式化结构化输出。LLMs 还可以添加到较小的模型之上,进行事后验证(Kim et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib36))、分类(Zhang et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib37))或选择(Chen et al., 2024b (https://arxiv.org/html/2607.26780#bib.bib38))。由于 Zhang et al. (2025 (https://arxiv.org/html/2607.26780#bib.bib9)) 强调了 LLMs 带来的更高成本和计算需求,Kim et al. (2025 (https://arxiv.org/html/2607.26780#bib.bib10)) 引入了一种插件架构,在流水线中同时使用 PLM 和 LLM,以同时考虑效率和泛化能力。

#### 产品领域的 IE。

尽管 IE 任务广泛适用于实际场景,但在产品信息方面,训练数据的稀缺常常阻碍使用传统方法进行 NER 应用(Schön et al., 2018 (https://arxiv.org/html/2607.26780#bib.bib33))。然而,LLMs 的发展为这一瓶颈带来了突破。Hätty et al. (2024 (https://arxiv.org/html/2607.26780#bib.bib35)) 强调了 LLMs 在提取显式标签方面的出色能力;此外,LLMs 还能提取隐式标签,而这在传统的词元分类方法中几乎无法实现。Brinkmann et al. (2024 (https://arxiv.org/html/2607.26780#bib.bib1)) 使用 GPT 模型研究了产品 IE,并暗示了归一化数值属性值的潜力。类似地,Li et al. (2025b (https://arxiv.org/html/2607.26780#bib.bib26)) 探讨了产品描述中的属性挖掘,引入了一个采用思维链推理方法的框架(Wei et al., 2022 (https://arxiv.org/html/2607.26780#bib.bib27))。

## 3 带验证任务的生成式 IE

### 3\.1 任务重新表述

在我们的实验中,我们将传统的生成式 IE 调整为验证任务,对 LLMs 使用两种任务表述:

1. 1\. 抽取:模型被要求从纯文本中识别实体并直接生成结构化输出。
2. 2\. 验证:包含两步生成:首先由 PLM 进行初始结构化预测。然后将预测结果提供给 LLM,由其验证并纠正初始输出(图 1 (https://arxiv.org/html/2607.26780#S1.F1))。

验证任务模仿了自精炼框架(Madaan et al., 2023 (https://arxiv.org/html/2607.26780#bib.bib28)),但没有递归提示。该方法也与在 NER 工作流中使用 LLMs 进行事后处理(Kim et al., 2024 (https://arxiv.org/html/2607.26780#bib.bib36); Chen et al., 2024b (https://arxiv.org/html/2607.26780#bib.bib38))相呼应,以利用 LLMs 的通用知识。

在验证任务中,我们为每个数据集微调了一个 RoBERTa 和一个 DeBERTa 模型,共产生了四种第一步 PLM 预测的设置。作为基线,LLMs 被要求纠正一个格式化为 PLM 输出的空字典,总计五个验证任务设置。

### 3\.2 实验

#### 数据。

聚焦产品领域以进一步应用于 DPP,我们使用两个开源数据集作为主要材料:Hugging Face Amazon Product Description²²²https://huggingface.co/datasets/philschmid/amazon-product-descriptions-vlm(以下简称 Amazon/AZ)和 Kaggle E\-commerce Text Classification³³³https://www.kaggle.com/datasets/saurabhshahane/ecommerce-text-classification(以下简称 E\-commerce/EC)。两个数据集均被重新采样到大约 500 个实例,然后由一名标注员使用 Label Studio(Tkachenko et al., 2020 (https://arxiv.org/html/2607.26780#bib.bib31))标注了六种命名实体标签(表 1 (https://arxiv.org/html/2607.26780#S1.T1))。标签定义见附录中的表 5 (https://arxiv.org/html/2607.26780#A1.T5)。

模型抽取验证基线RoBERTa\-AZRoBERTa\-ECDeBERTa\-AZDeBERTa\-ECAmazonLlama\-3\.2 3B53\.0753\.2046\.4943\.7646\.8144\.46Llama\-3\.1 8B54\.1758\.91\\cellcolorgreen\!1061\.45\*\\cellcolorgreen\!1058\.06\\cellcolorgreen\!1060\.90\\cellcolorgreen\!1058\.28Llama\-3\.3 70B70\.0170\.71\\cellcolorgreen\!1072\.94\\cellcolorgreen\!1071\.44\\cellcolorgreen\!1072\.84\\cellcolorgreen\!1071\.33Mistral\-0\.3 7B46\.4850\.6839\.13\*36\.8641\.3238\.66Mistral\-small\-3\.1 24B66\.4962\.89\\cellcolorgreen\!1069\.36\\cellcolorgreen\!1067\.20\\cellcolorgreen\!1069\.72\\cellcoloryellow\!1566\.45Gemma\-3 4B53\.2452\.09\\cellcolorgreen\!1055\.1950\.88\\cellcolorgreen\!1056\.69\\cellcoloryellow\!1552\.87Gemma\-3 27B65\.0366\.50\\cellcolorgreen\!1072\.64\\cellcolorgreen\!1067\.63\\cellcolorgreen\!1072\.39\\cellcolorgreen\!1067\.74E\-commerceLlama\-3\.2 3B30\.2727\.1623\.82\\cellcoloryellow\!1529\.3926\.12\\cellcoloryellow\!1530\.04Llama\-3\.1 8B35\.7938\.75\\cellcoloryellow\!1537\.12\\cellcolorgreen\!1042\.24\*\\cellcoloryellow\!1537\.50\\cellcolorgreen\!1042\.80Llama\-3\.3 70B44\.4844\.89\\cellcolorgreen\!1046\.32\\cellcolorgreen\!1046\.49\\cellcolorgreen\!1046\.03\\cellcolorgreen\!1046\.74Mistral\-0\.3 7B30\.4833\.08\\cellcoloryellow\!1532\.74\\cellcolorgreen\!1034\.75\*\\cellcolorgreen\!1033\.52\\cellcolorgreen\!1034\.99Mistral\-small\-3\.1 24B44\.5743\.23\\cellcoloryellow\!1544\.23\\cellcolorgreen\!1049\.64\\cellcolorgreen\!1046\.57\\ce

相似文章

合成验证:LLMs如何将认可与现实脱钩

Reddit r/ArtificialInteligence

本文认为,LLMs提供了合成验证,模仿了人类的认可而没有真实的风险,导致潜在的社会和心理后果,如韧性降低和孤立增加。