在强制迁移和FCV文档中提取数据集引用:一个基于LLM标签精炼的弱监督框架
摘要
该论文介绍了一个使用大型语言模型从强制迁移和FCV文档中提取数据集引用的弱监督框架,在有限标注数据下实现了高精度。
arXiv:2609.12107v1 Announce Type: new
摘要:发展与人道主义组织生产和支持调查、行政登记册和其他数据资源,以支持研究、政策和运营,但系统性地识别这些数据集被引用的位置仍然困难。这些引用分散在研究论文、项目文档、人道主义报告和其他非结构化文本中,限制了跟踪数据使用和识别数据可用性或传播中潜在缺口的能力。我们提出了一个弱监督框架,用于将数据集提取适应于强制迁移和脆弱、冲突与暴力(FCV)文档,而无需首先构建大型手动标注的训练语料库。一个在通用研究文献上训练的轻量级模型从未标注的领域文档中生成候选数据集引用,一个前沿的大型语言模型(LLM)在上下文中审查这些候选,验证或拒绝候选并纠正其提取边界。生成的标注通过有针对性的合成和对比示例进行补充,并用于微调轻量级模型以进行大规模提取。我们在一个独立的金标准基准上评估了生成的模型,该基准包含1,706个跨越研究、人道主义和运营文档的文本段落。在整个基准中,模型在引用级别上实现了74.1\%的精确度和70.5\%的召回率;在包含数据集引用的段落中,精确度达到89.5\%。在段落级别,模型在区分包含数据集引用的段落和不包含的段落时,实现了88.2\%的准确度和88.6\%的特异性。这些结果证明了一种在标注数据有限时构建领域特定监督的实用方法,并为大规模分析数据使用和迁移数据景观中的潜在缺口提供了技术基础。
查看缓存全文
缓存时间: 2026/09/14 08:27
# 强制流离失所与FCV文档中数据集提及的提取:基于大语言模型标签精炼的弱监督框架
来源:https://arxiv.org/html/2609.12107
Aivin V. Solatorio*& Olivier Dupriez
所属机构:发展数据组
所属机构:世界银行集团首席统计师办公室
所属机构:世界银行
所属机构:美国华盛顿特区H街西北1818号
所属机构:邮编20433
所属机构:邮箱\{rmacalaba, asolatorio, odupriez\}@worldbank.org
Patrick Michael Brock
所属机构:世界银行-联合国难民署联合数据中心
所属机构:联合国城
所属机构:丹麦哥本哈根Marmorvej 51号,邮编2100
所属机构:邮箱[email protected]
###### 摘要
发展与人道主义组织生产和支持调查、行政登记册及其他数据资源,以支持研究、政策与运作,但系统性识别这些数据集的引用位置仍然困难。这些引用分散在研究论文、项目文件、人道主义报告及其他非结构化文本中,既限制了追踪数据使用的能力,也阻碍了识别数据可用性或传播方面的潜在缺口。我们提出一种弱监督框架,用于在无需预先构建大规模人工标注训练语料库的情况下,将数据集提取适应于强制流离失所与脆弱、冲突及暴力(FCV)文档。该框架首先利用在通用研究文献上训练的轻量级模型,从未标注的领域文档中生成候选数据集提及,再由前沿大语言模型(LLM)在上下文中审查这些候选,验证或拒绝候选并修正其提取边界。生成的标注辅以针对性合成与对比样本,用于微调轻量级模型以实现大规模提取。我们在包含1,706个文本段落的独立黄金标准基准上评估最终模型,这些段落涵盖研究、人道主义与运作文档。在整个基准测试中,模型在提及层面达到74.1%的精确率和70.5%的召回率;在包含数据集引用的段落中,精确率高达89.5%。在段落层面,模型在区分包含与不包含数据集引用的段落时,准确率为88.2%,特异性为88.6%。这些结果证明了一种在标注数据有限时构建领域特定监督的实用方法,并为分析流离失所数据格局中的数据使用与潜在缺口提供了技术基础。
11footnotetext:GitHub/HF:@avsolatorio(https://github.com/avsolatorio),[[email protected]](mailto:[email protected])
22footnotetext:GitHub:@rafmacalaba(https://github.com/rafmacalaba),[[email protected]](mailto:[email protected])
## 1 引言
脆弱、冲突及暴力(FCV)与强制流离失所环境下的实证研究、政策制定与运作决策可依赖家庭调查、行政登记册、社会经济评估及其他专用数据资源。然而,系统性追踪这些资源的引用位置仍然困难。数据集引用实践不一致,且引用并非总通过标准化引用或持久标识符捕获(Buneman等人,2021;Piwowar与Vision,2013;Silvello,2018)。这为数据稀缺环境中生产、资助和传播数据的发展与人道主义组织创造了特殊机遇。世界银行、联合国难民署(UNHCR)及强制流离失所联合数据中心(JDC)等组织生产或支持的数据集可能出现在研究论文、政策文件、项目文件、人道主义报告、脚注及其他非结构化文本中,而非通过一致的书目引用(Mooney与Newton,2012)。规模化识别这些引用可服务于两个互补目的:首先,揭示现有数据资源在研究、政策与运作中的采纳情况,为其影响力和对循证分析与决策的贡献提供证据;其次,结合数据存在性、可用性及覆盖人群与主题的信息,使用与未使用的模式有助于识别数据生产、可及性或传播方面的潜在缺口。因此,此类证据不仅能支持对数据投资的事后监测,还能为未来在数据生产与传播方面投资最具价值的方向提供前瞻性决策依据。
自动化信息提取提供了实用解决方案。近期模型已提升从非结构化文本中识别实体与结构化信息的能力(NuMind,2024;Hussain等人,2023),而通用命名实体识别模型如GLiNER(Zaratiana等人,2023)为识别专用实体类型提供了灵活基础。将这些方法应用于FCV与强制流离失所文档的主要挑战在于领域特定标注数据的有限性。在研究文献上训练的模型可能无法直接迁移到专用文档,而人工构建大型训练语料库需要大量专家标注。我们通过利用现有数据集提取模型作为弱监督来源来解决此问题。先前在通用研究文献上训练的轻量级模型(Macalaba与Solatorio,2026)首先用于从未标注的FCV与强制流离失所文档中生成候选提及。随后,前沿大语言模型(LLM)在上下文中审查这些候选,验证或拒绝并修正其提取边界。生成的标注辅以针对性合成与对比样本,用于微调轻量级模型以适应目标领域。该方法利用LLM构建更高质量的训练数据,同时保留轻量级模型用于大规模推理。
我们在包含1,706个文本段落的独立黄金标准基准上评估最终模型,这些段落涵盖研究、人道主义与运作文档。评估考虑模型是否正确提取数据集提及,以及是否正确区分包含与不包含数据集引用的段落。
本文贡献包括:第一,提出一种弱监督框架,结合现有提取模型、LLM辅助标注精炼与针对性合成数据,在标注样本稀缺时构建领域特定训练数据;第二,展示如何将此监督迁移到轻量级本地模型以进行大规模数据集提取;第三,在涵盖多种FCV与强制流离失所文档类型的独立异构黄金标准基准上评估最终模型。可靠提取数据集引用是构建流离失所数据全局图景的技术基础之一。文本引用本身无法确立数据集如何使用、是否影响决策或结果,或是否因缺少引用而表明真实数据缺口。因此,本研究评估提取能力,而非试图估计流离失所数据使用的全局格局。其基准旨在测试跨异构研究、人道主义与运作文档类型的迁移能力,而非构成所有与强制流离失所相关的政策、研究与运作材料的代表性语料库。将该框架应用于更广泛实质目标时,还需系统构建语料库、过滤流离失所相关性、解析与链接数据集,以及对已识别数据的使用进行语境分类。这些扩展将在未来工作中探讨。
## 2 相关工作
### 2.1 数据集引用与可发现性
不一致的数据引用实践是追踪数据使用的长期障碍。Mooney与Newton(2012)记录了类似学术出版物的稳定数据集引用惯例的缺失,Silvello(2018)形式化了数据引用系统支持发现、重用与归属必须满足的要求。Buneman等人(2021)将此扩展到引用图本身,展示将数据引用链接到出版物引用如何能大规模提升数据集可发现性。Piwowar与Vision(2013)提供实证证据,表明具有持久标识符的数据集被重用和引用更频繁,强调了对世界银行和UNHCR等大量投资数据生产的组织系统追踪引用的实际价值。
我们的工作补充了这一文献:我们不提出引用标准,而是提取数据集中在非结构化文本中的实际出现形式,这仍然是当今发展与人道主义文档中引用的主导模式。引用实践与观测数据使用之间的关系也激励了提取框架的潜在下游应用。更标准化与持久的引用可能使数据集更易被用户发现,也便于组织跨下游文档追踪。本研究未测试改进引用实践是否导致更多数据使用。然而,规模化应用提取器可能为未来实证分析奠定基础,以研究具有更强文档、持久标识符、标准化引用指南或更高可及性的数据集是否随后在更广泛的研究、政策与运作文档中被引用。此类分析可为数据文档与传播投资提供额外证据基础。
### 2.2 自动化数据集提及提取
越来越多的工作直接应用信息提取方法解决数据集提及识别问题。Heddes等人(2021)应用基于Transformer的命名实体识别标记器检测科学文章中的数据集名称,Hussain等人(2023)在应用于同一基础任务的类似提取框架中结合基于Transformer的问答与命名实体识别模型。Younes与Scherp(2023)直接比较命名实体识别与问答方法提取先前未见数据集名称的效果,发现问答公式对训练数据中缺失的数据集泛化更好——这促使我们使用LLM而非固定标记器进行候选判定。
超越个别研究贡献,Potok(2022)描述“Show US the Data”,一个多机构美国政府试点项目,应用AI方法提高文献中引用的公共数据集的可发现性,表明自动化数据集提及追踪也是机构活跃优先事项,而不仅仅是研究问题。我们先前工作使用合成与LLM辅助数据构建研究文献的数据集提取模型(Solatorio等人,2025),并在世界银行政策研究工作论文上大规模评估(Macalaba与Solatorio,2026;Macalaba与Solatorio,2025)。本文沿此方向拓展新路径:不改进研究文献的提取,而是将现有研究文献模型适应于显著不同的文档分布——人道主义、运作与FCV文档——其中数据集引用更稀少、更不标准化,且更常与项目标题及行政系统一同出现。这种领域迁移设置是本工作的主要方法论焦点。
### 2.3 弱监督与LLM辅助标注
我们的候选生成后精炼设计借鉴了Ratner等人(2017)形式化的弱监督范式,其中噪声、程序化或模型生成的标签被组合与去噪,而非从头人工策划。Snorkel式系统通常概率性组合多个标注函数,而我们使用单个上游模型生成候选,并由前沿LLM在上下文中逐个判定——这种设计基于LLM数据编程与自训练方法(如Self-Instruct)的精神,其中强模型用于为下游任务生成与筛选训练信号。这也与主动学习(Settles,2009)相关,因为两者均旨在将有限标注精力集中于信息最丰富处;我们的方法在候选审查步骤用LLM判定替代人类神谕,同时仍依赖严格人工构建的黄金标准集进行最终评估。
本文将这种LLLM精炼弱监督管道应用于将数据集提及提取迁移至人道主义与FCV文档集合的具体问题。
### 2.4 强制流离失所与FCV环境中的数据使用
强制流离失所的规模与持续性使得可靠、可及且与政策相关的数据成为在这些环境中运作组织的战略优先事项(UNHCR,2025)。世界银行-联合国难民署强制流离失所联合数据中心(JDC)2024–2027战略强调四个互补优先事项:系统性将强制流离失所与无国籍人群纳入国家统计;定向生产高质量数据与及时分析以支持政策与项目;数据创新以提升数据质量、时效与可及性;以及操作化数据与证据以强化强制流离失所解决方案(世界银行-联合国难民署强制流离失所联合数据中心,2024)。世界银行集团FCV战略2026–2030同样强调更早预测FCV风险、差异化参与不同FCV环境、以就业为中心强化“一个世界银行集团”方法,以及加强运作工具与伙伴关系(世界银行集团,2026)。UNHCR数据转型战略(UNHCR,2020)进一步强调数据系统、技术与负责任数据使用在人道主义环境中的作用。这些战略优先事项补充了在脆弱与受影响流离失所环境中生产与使用数据的实践与治理挑战(Hoogeveen与Pape,2020)。相似文章
社交媒体中因果关系提取的大型语言模型:灾害情报的验证框架
本文提出了一个验证框架,用于评估大型语言模型(LLM)在灾害期间从社交媒体帖子中提取因果关系的有效性。通过将LLM生成的结果与基于专家知识的参考图谱进行比较,评估其在识别因果关系方面的可靠性及潜在风险。
利用外部知识通过检索增强型大语言模型进行历史文档修复
本文介绍了ARI,一个利用检索增强型大语言模型修复历史文档中难以辨认部分的框架,通过将隐式的大语言模型知识与显式检索的外部历史背景相结合,显著提升了命名实体的修复效果。
DataDignity:用于大型语言模型的训练数据归属
本文介绍了 DataDignity,这是一个针对精准溯源(pinpoint provenance)的框架与基准(FakeWiki),旨在识别支持大语言模型(LLM)回答的具体训练数据来源。文章提出了 ScoringModel 和 SteerFuse 两种方法,以在标准检索基线之上提高归属准确率。
使用大型语言模型标注实体匹配的训练数据
本文研究使用大型语言模型作为教师模型来标注实体匹配的训练数据,结果表明,在机器标注数据上训练的学生模型与在人工标注基准上训练的模型性能相当,并且具有显著的成本和速度优势。
使用大语言模型在危机报告中提取和三角验证因果证据:基于ReliefWeb的研究
本文提出了一种两阶段的大语言模型流水线,用于从人道主义危机报告中提取和三角验证因果证据,在ReliefWeb数据集上取得了较高的F1分数,并提出了一种证据水平评分,用于衡量跨情境的一致性。