用于监测和分类研究文献中数据使用的AI

arXiv cs.CL 论文

摘要

本文提出了一种基于多任务GLiNER的框架,用于可扩展地监测研究文献中的数据集使用情况。该框架利用合成数据生成和基于LLM的重新验证,以解决提取、关系识别和使用分类中的挑战。

arXiv:2605.30582v1 公告类型:新 摘要:尽管Google Scholar和Semantic Scholar等平台能够追踪学术论文的引用,但尚无类似基础设施用于监测研究文献中的数据集使用情况,导致数据使用格局在很大程度上不透明。填补这一空白对于透明度、可重复性和影响监测至关重要,但其进展受到引用实践不一致、标注数据稀缺以及数据集中模糊引用的阻碍。传统的NLP方法难以应对这些挑战,从而推动了向更具适应性、语义更丰富的模型的转变。基于先前利用LLM进行数据提及检测和利用合成数据进行引导训练的工作,本文提出了一种用于可扩展数据集监测的更新方法。我们引入了一个基于多任务GLiNER的框架,该框架联合执行数据集提及提取、关系识别和使用上下文分类。为了解决标签稀缺问题,该流程利用合成数据生成来产生训练样本,并利用基于LLM的重新验证来过滤错误提及并强制标注一致性,从而共同提高了整个训练流程的可靠性、覆盖率和输出一致性。这项工作推动了用于监测研究文献中数据使用的开源工具的开发,有助于实现更广泛的目标,即实现可泛化、无约束的数据集引用追踪。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:26

# 用于监测和分类研究文献中数据的AI  
来源:https://arxiv.org/html/2605.30582  

Rafael Macalaba†& Aivin V\. Solatorio∗  
发展数据组  
世界银行集团首席统计学家办公室  
世界银行  
美国华盛顿特区西北区H街1818号,邮编20433  
\{rmacalaba, asolatorio\}@worldbank\.org  

###### 摘要  
尽管Google Scholar和Semantic Scholar等平台能够追踪学术论文的引用情况,但目前尚无类似的基础设施来监测研究文献中的数据集使用情况,导致数据使用格局在很大程度上不透明。填补这一空白对于透明度、可重复性和影响监测至关重要,然而,不规范的引用实践、稀缺的标注数据以及研究文献中对数据集的模糊引用阻碍了进展。传统的自然语言处理方法难以应对这些挑战,促使研究转向更具适应性、语义更丰富的模型。基于先前利用大语言模型进行数据提及检测以及使用合成数据启动训练的工作,本文提出了一种更新的方法论,用于实现可扩展的数据集监测。我们引入了一个基于多任务GLiNER的框架,该框架联合执行数据集提及抽取、关系识别和使用情境分类。为解决标签稀缺问题,该流程利用合成数据生成来产生训练样本,并采用基于大语言模型的重新验证来过滤错误提及并强制执行标签一致性,从而共同提高整个训练流程的可靠性、覆盖率和输出一致性。这项工作推动了用于监测研究文献中数据使用的开源工具的发展,有助于实现可泛化、无约束数据集引用追踪这一更广泛的目标。  

11footnotetext:GitHub/HF:@avsolatorio (https://github.com/avsolatorio),avsolatorio@gmail\.com (https://arxiv.org/html/2605.30582v1/mailto:[email protected])  
22footnotetext:GitHub:@rafmacalaba (https://github.com/rafmacalaba),rafael\.macalaba@yahoo\.com (https://arxiv.org/html/2605.30582v1/mailto:[email protected])  

## 1 引言  

数据集对于实证研究至关重要,是分析、验证和政策制定的基础 (Mooney and Newton,2012 (https://arxiv.org/html/2605.30582#bib.bib1); Silvello,2018 (https://arxiv.org/html/2605.30582#bib.bib2))。然而,由于不规范的引用实践和有限的结构化元数据,追踪数据集在研究文献中的引用和使用方式仍然具有挑战性 (Bunemanet al\.,2021 (https://arxiv.org/html/2605.30582#bib.bib3); Piwowar and Vision,2013 (https://arxiv.org/html/2605.30582#bib.bib4))。手动提取数据集提及在大规模场景下不可行,这促使近年来应用人工智能和自然语言处理进行自动检测 (Potoket al\.,2022 (https://arxiv.org/html/2605.30582#bib.bib5); Heddeset al\.,2021 (https://arxiv.org/html/2605.30582#bib.bib6); Hussainet al\.,2025 (https://arxiv.org/html/2605.30582#bib.bib7))。我们之前的工作引入了一个大语言模型框架,该框架结合了合成数据生成和基于大语言模型的重新验证,以增强数据集提及检测和标签一致性 (Solatorio and Macalaba,2025 (https://arxiv.org/html/2605.30582#bib.bib10))。虽然该方法实现了高召回率,并有效扩展了低资源训练数据,但保持模型输出的事实准确性仍然具有挑战性——像Phi-3这样的通用指令调优模型有时会臆造或改写数据集名称,而不是逐字复制。这些观察促使我们开发一种更专门化、受控的架构,用于精确、结构化地提取数据集提及及其属性。  

本文介绍了一种更新的方法论,其核心是基于多任务GLiNER的架构 (Zaratianaet al\.,2023 (https://arxiv.org/html/2605.30582#bib.bib9))。该模型在单一训练流程中统一了数据集提及抽取、关系识别(例如,生产者、缩写、地理区域、年份)和使用情境分类。同时保留了原始框架的优势——合成数据生成和基于大语言模型的重新验证——简化了模型设计,并提高了结构化抽取的准确性。在原始标注语料库和新文档集合上评估,多任务GLiNER框架相比之前基于GLiNER-large-v2.1 (Zaratianaet al\.,2023 (https://arxiv.org/html/2605.30582#bib.bib9)) 和 NuExtract (Cripwellet al\.,2024 (https://arxiv.org/html/2605.30582#bib.bib12)) 的基线方法,表现出一致的提升。通过将数据集使用监测扩展为一个集成的抽取和分类框架,该更新支持对研究文献中数据使用进行更可扩展、更透明、更可重复的追踪。  

参见图注  

图1:数据使用抽取工作流,展示了基于多任务GLiNER的框架。  

## 2 方法论  

本节介绍用于监测研究文献中数据集提及的更新方法论。基于我们之前的框架,我们专注于通过统一的多元任务架构提高抽取准确性、可解释性和效率。为了解决标注训练数据有限的问题,我们继续采用大规模合成数据生成,并结合基于大语言模型的重新验证,以构建一个弱监督的训练语料库。整体工作流程——涵盖检测数据集提及(命名实体识别)、关系抽取及使用情境——如图1所示。  

### 2.1 数据  

训练的主要语料库来源于世界银行的《政策研究工作论文》(PRWP)系列 (World Bank,2025 (https://arxiv.org/html/2605.30582#bib.bib13))。111https://documents.worldbank.org/en/publication/documents-reports/documentlist?docty_exact=Policy+Research+Working+Paper  
我们关注涉及强制流离失所、难民和移民主题的论文,因为这些领域经常依赖来自多个来源的调查、普查和行政微观数据。相关PRWP通过元数据过滤器和标题及摘要中的关键词搜索(例如,“难民”、“流离失所”、“庇护”、“移民”、“国内流离失所者”)进行识别。从开放获取库下载全文PDF,并使用PyMuPDF PDF转文本工具将其转换为纯文本。排除包含致谢、参考文献和表格的部分,以避免误报。每份处理过的文档连同其元数据——出版年份、作者和地理关注点——一起存储,以支持上下文感知的标注和评估。最终过滤后的子集作为手动标注和初始模型训练的基础。  

对于评估,我们将更新后的框架应用于三个不同的文档集。首先,v1原始数据集——我们之前研究中标注的语料库——用于确保版本间结果的可比性。其次,我们纳入了来自强制流离失所联合数据中心的科研和分析出版物,这提供了与难民和流离失所研究相关的额外领域覆盖。最后,我们在更广泛的《政策研究工作论文》集合上评估了性能,以评估模型在主题和写作风格上的泛化能力。这些来源共同提供了一个平衡的测试平台,涵盖特定领域和一般研究背景,支持对模型可扩展性和一致性进行稳健评估。  

#### 2.1.1 使用Gradio接口进行手动标注  

手动标注通过一个定制的基于Gradio的界面进行,该界面旨在高效地识别研究论文全文中的数据集提及及其关联属性(见附录4)。标注人员高亮标记提及数据集的文本片段,并将其分类为命名、未命名或模糊。他们还将每个提及与上下文关系(如缩写、出版商、参考人群、出版年份和地理区域)进行关联(如果可用)。每个标注记录保留了页码和文档来源,确保标注示例的可追溯性和可复制性。以下是从Gradio接口导出的一个标注记录示例:  

1{  
2"text":"GBVisparticularlyprevalentinIDPsettlements,amongminorityclans,  
3andinconflictzones\.\.\.basedonSomaliaDemographicandHealthSurvey\(2020\)\.",  
4"datasets":[  
5{  
6"start":982,  
7"end":1019,  
8"text":"SomaliaDemographicandHealthSurvey",  
9"label":"named"  
10}  
11],  
12"relations":[  
13{  
14"source":"SomaliaDemographicandHealthSurvey",  
15"relation":"referencepopulation",  
16"target":"Somaliwomen"  
17},  
18{  
19"source":"SomaliaDemographicandHealthSurvey",  
20"relation":"publisher",  
21"target":"WorldBank"  
22},  
23{  
24"source":"SomaliaDemographicandHealthSurvey",  
25"relation":"publicationyear",  
26"target":"2020"  
27}  
28],  
29"source":"Differences\-in\-Household\-Composition\-Hidden\-Dimensions\-of\-Poverty\-and\-Displacement\-in\-Somalia\.pdf",  
30"page":11  
31}  

每个标注的JSON记录捕获了 (i) 原始文本片段,(ii) 所有识别出的数据集提及及其偏移量和标签,(iii) 抽取或标注的关系,以及 (iv) 将实例链接到其文档来源的元数据。这种结构化表示为监督学习和多任务学习提供了高保真基础,使模型能够联合捕获提及边界和上下文属性。  

#### 2.1.2 合成数据生成  

为了将数据集提及的多样性和覆盖范围扩展到强制流离失所领域之外,我们采用了基于大语言模型的合成数据生成方法,使用OpenAI GPT API。该过程通过创建模仿研究文献中语言和结构多样性的弱监督训练数据,解决了标注示例稀缺的问题。提示模板旨在使模型适应现实的数据集使用场景,并鼓励生成命名性和描述性的数据集提及。每一轮生成都结合了来自手动标注PRWP语料库的种子示例以及受控指令,指定:  
- •要生成的数据集提及类型(命名、描述性或模糊);  
- •领域或主题背景(例如,健康、教育、农业、环境);  
- •以及可选的元数据字段,如缩写、生产者、年份和地理区域。  

生成的合成语料库捕获了广泛的措辞模式和领域背景,提高了模型在微调过程中的鲁棒性和泛化能力。合成数据生成工作流的详细说明,包括提示公式化和与标注数据的集成,见附录2。  

#### 2.1.3 使用情境数据标注  

为了补充提及和关系数据,我们为合成语料库中的每个数据集提及自动生成了使用情境标签。该过程将每个数据集在周围文本中的使用方式分类为主要、辅助或背景。我们采用基于大语言模型的分类脚本,为模型提供文档文本、抽取的数据集提及和明确的角色定义。模型被提示输出结构化的JSON,包含提及、分配给它标签以及简要说明分类依据的解释。这种方法无需手动标注即可快速创建标注示例,同时通过自然语言理由保持可解释性。以下显示了核心逻辑的一个示例,其中每个条目被传递给大语言模型,并解析结构化响应以集成到合成数据集中:  

1Youareanexpertresearchassistant\.ClassifytheroleofEACHdatasetmentioninthetext\.  
2  
3Definitions:  
4\-Background:Mentionedasprior/relatedwork,notanalyzedinthestudy\.  
5\-Supporting:Complementsfindingsbutnotcentraltoanalysis\.  
6\-Primary:Maindatasetanalyzedinthestudy\.  
7  
8ExpectedJSONOutput:  
9{  
10"results":[  
11{  
12"mention":"",  
13"label":"",  
14"explanation":"<1\-3sentencerationale>"  
15}  
16]  
17}  

这个自动化标注流程大大减少了人工工作量,同时为微调多任务GLiNER模型提供了高质量的监督信号。  

#### 2.1.4 大语言模型作为法官的重新验证流程  

为了确保标签一致性并减少扩展数据集中误报,我们引入了一个基于大语言模型的重新验证流程。该阶段作为模型推理和重新训练之间的自动化质量控制过滤器。每个提取的记录——包含文本、数据集和关系——由大语言模型使用结构化验证提示(见附录A.3,图A.3)进行重新评估。重新验证提示定义了有效数据集提及和关系的构成,区分为命名、描述性和模糊数据集。对于每个预测的提及,模型必须决定是:  
- •保留提及(如果它指代一个有效的数据集或数据集合);  
- •删除提及(如果它对应非数据集实体,如组织、机构或概念框架)。  
然后对各关系进行交叉检查,以确保每个链接对应于一个保留的数据集提及。模型输出相同的JSON结构,并增加了动作(保留/删除)字段和理由字段,以增强可解释性。这个验证循环利用大语言模型的上下文推理来强制执行标注模式,无需额外的人工监督。通过在重新训练前过滤不一致或虚假预测,该流程提高了数据精度,并稳定了后续微调的性能。重新验证提示的完整示例见附录3,包括推理过程中使用的指令和结构化示例。  

### 2.2 多任务GLiNER架构  

为了扩展我们之前关于数据集提及抽取的工作,我们采用了通用语言推理命名实体识别模型的多任务变体 (Zaratianaet al\.,2023 (https://arxiv.org/html/2605.30582#bib.bib9))。该版本在单个基于Transformer的框架中集成了三个相互关联的任务——数据集提及抽取、关系识别和使用情境分类。多任务配置赋予了模型与数据集使用监测密切相关的三种集成能力。首先,它识别文本中的数据集提及——既包括正式命名的资源,也包括对数据集合的描述性引用。其次,它提取相关的元数据和上下文属性,如生产者、缩写、出版年份、数据地理区域和参考人群。最后,它通过将数据集的使用情境分类为主要、辅助或背景来解释每个数据集在研究中的使用方式。这些能力共同实现了从非结构化文本直接导出结构化且可解释的数据集使用表示。  

这种统一设计使模型能够捕获数据集提及、其描述性属性及其在周围叙述中的功能角色之间的依赖关系。通过联合训练所有组件,该框架产生更连贯和可追溯的结构化输出——支持跨研究文献对数据集使用进行可扩展监测。  

#### 2.2.1 命名实体识别组件  

命名实体识别组件作为框架的基础,识别与研究论文中提到数据集或数据集合相对应的文本跨度。其目标是检测各种数据集引用,从显式命名的资源(如Demographic and Health Surveys 或 Living Standards Measurement Study)到更描述性的提及(如“家庭收入调查”

相似文章

Gate AI:LLM安全基准评估方法与结果

arXiv cs.LG

本文提出了一种针对LLM安全检测器的评估方法,旨在解决诸如按数据集调阈值、未公开操作点等系统性缺陷。该框架在16个基准上进行交叉验证,选取单一全局操作点,并包含多项泛化能力诊断指标。

@dair_ai: https://x.com/dair_ai/status/2056018543850754283

X AI KOLs Following

一份关于5月11日至17日顶级人工智能论文的综述,涵盖了用于长上下文预训练的Lighthouse Attention、grep与嵌入检索在编码代理中的对比,以及揭示LLMs中几何计算器的机制可解释性工作。