Meddies-PII: 一个多语言框架,用于临床去标识化中个人可识别信息的提取

arXiv cs.CL 论文

摘要

本文介绍了Meddies-PII,这是一个用于生成多语言合成临床数据集的框架,以训练个人可识别信息提取模型,并在基准测试中实现了最先进的性能。

arXiv:2609.12544v1 公告类型:新 摘要:临床去标识化依赖于准确识别个人可识别信息(PII)。然而,手动标注的数据集构建成本高昂,而现有的合成替代方案通常对其生成过程提供有限的细节或依赖于相对简单的合成策略。我们介绍了Meddies-PII-Dataset,这是一个包含一百万份合成临床文档的语料库,涵盖十七种语言和九种PII标签。这些文档使用属性条件提示生成,并通过十三个确定性门控进行验证,以确保结构和标注的一致性。为了评估数据集的实用性,我们训练了Meddies-PII-Model,一个BIOES标记分类器,并使用精确匹配实体级F1分数将其与现有的PII提取系统进行比较。Meddies-PII-Model在所有报告的基准测试中实现了最高的性能,在十五个外部基准测试中的平均F1分数为0.827,而最强基线为0.658。在接受后,我们将公开发布数据集、基准测试套件、模型、生成框架和评估代码,以支持多语言临床去标识化的研究。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:37

# Meddies-PII:用于临床去标识化中个人可识别信息提取的多语言框架
来源:https://arxiv.org/html/2609.12544  
作者:Christian Hoang1与Huy Hoang Ha1,†  
地址:1Meddies AI,越南  
†通讯作者:hoangha@meddies\.ai  

###### 摘要  
临床去标识化依赖于准确识别个人可识别信息(PII)。然而,人工标注数据集的构建成本高昂,现有的合成替代方案通常提供的生成细节有限或使用相对简单的合成策略。我们推出了 Meddies-PII 数据集,其中包含一百万份覆盖十七种语言和九个PII标签的合成临床文档。通过属性条件提示生成文档,并由十三个确定性门控检查其结构和标注有效性。为评估该数据集的实用性,我们训练了 Meddies-PII 模型——一个BIOES序列标注分类器。我们使用精确匹配实体级F1分数将其与现有的PII提取系统进行比较。在所有报告的基准测试中,Meddies-PII 模型在评估系统中取得了最高分,在十五个外部基准上的平均F1分数为0.827,而最强基线为0.658。论文被接收后,我们将公开发布该数据集、基准测试、模型、生成框架和评估代码,以支持多语言临床去标识化的研究。

###### 关键词  
自然语言处理;命名实体识别;个人可识别信息;合成数据;医疗保健  

\setCJKmainfont FandolSong\-Regular\.otf  
\copyrightinfo 预印本文章已提交至Pacific Symposium on Biocomputing进行评审 © 2026 World Scientific Publishing Co., Singapore, http://psb\.stanford\.edu/  

## 1 引言  
命名实体识别(NER)是自然语言处理中的基础任务。然而,在医疗保健等隐私敏感领域,主要目标是识别个人可识别信息(PII),这是命名实体的一个专门子集,其披露可能危及患者隐私[1 (https://arxiv.org/html/2609.12544#bib.bib1)]。尽管PII提取通常被建模为NER任务,但它在本体和应用目标上与通用NER有所不同。因此,数据驱动的PII系统需要专门的数据集,而不能仅仅依赖传统的NER语料库。现有的PII数据集主要依靠人工标注,构建成本高昂,限制了其规模、语言覆盖范围和领域多样性[2 (https://arxiv.org/html/2609.12544#bib.bib2),3 (https://arxiv.org/html/2609.12544#bib.bib3),4 (https://arxiv.org/html/2609.12544#bib.bib4)]。尽管最近提出了一些合成PII数据集,但大多数要么未公开其生成流程,要么依赖于相对简单的提示策略[5 (https://arxiv.org/html/2609.12544#bib.bib5),6 (https://arxiv.org/html/2609.12544#bib.bib6),7 (https://arxiv.org/html/2609.12544#bib.bib7)]。我们提出了一个多语言合成数据生成框架,该框架结合了属性条件提示和确定性验证,以构建 Meddies-PII 数据集。该框架控制语言、文档类型、文本格式、场景、本体约束和具有挑战性的边缘案例,以生成多样且结构复杂的文档。在纳入数据集之前,违反声明要求的生成样本会被修复或拒绝。我们进一步训练了一个序列标注模型来评估所得数据的实用性。我们在十五个外部基准和 Meddies-PII 基准上评估了该模型。我们的基准结合了 Meddies-PII 本体下的标准案例和困难案例,以评估不同难度级别上的性能。本文做出了三项贡献:{arabiclist}\[\(3\)\] 我们介绍了 Meddies-PII 数据集,这是一个合成的临床PII数据集,包含一百万份跨越十七种语言的文档,并使用九标签PII本体进行标注。我们提出了一个受控的多语言合成框架,该框架结合了多种文档和生成属性,并进行了确定性的结构和标注验证。我们介绍了 Meddies-PII 模型——一个BIOES序列标注分类器,并展示其在所有评估的外部基准和我们的基准上均达到最高性能。

## 2 相关工作  
### 2.1 PII 数据集  
#### 人工标注数据集  
人工标注的PII数据集支持监督训练和评估,但专家标注使其构建成本高昂且难以扩展[8 (https://arxiv.org/html/2609.12544#bib.bib8)]。早期的临床去标识化资源主要关注英语医疗记录,并支持有影响力的共享任务和系统评估[2 (https://arxiv.org/html/2609.12544#bib.bib2),3 (https://arxiv.org/html/2609.12544#bib.bib3),4 (https://arxiv.org/html/2609.12544#bib.bib4)]。非英语临床资源包括法语临床笔记语料库和德语GRASCCO语料库[9 (https://arxiv.org/html/2609.12544#bib.bib9),10 (https://arxiv.org/html/2609.12544#bib.bib10)]。敏感实体数据集也已为西班牙语法律文本开发,显示出超越临床领域的进展[11 (https://arxiv.org/html/2609.12544#bib.bib11)]。最近的多语言资源扩大了这种覆盖范围,但人工标注的数据集仍然涵盖的语言和领域相对较少[12 (https://arxiv.org/html/2609.12544#bib.bib12)]。  

#### 合成数据集  
合成为人工标注数据集提供了一种可扩展的替代方案,最近已发布了几个大型PII数据集[5 (https://arxiv.org/html/2609.12544#bib.bib5),6 (https://arxiv.org/html/2609.12544#bib.bib6),7 (https://arxiv.org/html/2609.12544#bib.bib7)]。然而,它们的生成过程并不总是描述得足够详细,无法复现用于文档多样性、标签覆盖和困难案例的控制措施。SPY [1 (https://arxiv.org/html/2609.12544#bib.bib1)] 更清晰地记录了其工作流程,包括迭代占位符插入、合成实体交换和无关实体的添加。Meddies-PII 数据集通过一个独立设计的多语言管道解决了这一可复现性差距,该管道明确控制文档和生成属性,并在接受样本前应用确定性验证。

### 2.2 PII 模型  
#### NER 技术  
NER系统识别文本片段并为每个片段分配实体标签。许多神经方法将此任务建模为序列标注,预测每个标记的标签,并可选地使用条件随机场(CRF)来建模相邻标签之间的依赖关系[13 (https://arxiv.org/html/2609.12544#bib.bib13)]。BERT等Transformer编码器通过将每个标记表示在其周围上下文中来改进这些预测[14 (https://arxiv.org/html/2609.12544#bib.bib14)]。基于片段的方法直接对候选片段评分,允许模型同时预测实体边界和标签[15 (https://arxiv.org/html/2609.12544#bib.bib15)]。最新的通用模型,包括GLiNER和GLiNER2,使用基于模式的接口来识别超出单一固定分类法的实体类型[16 (https://arxiv.org/html/2609.12544#bib.bib16),17 (https://arxiv.org/html/2609.12544#bib.bib17)]。  

#### PII 技术  
PII提取专门化了NER,将检测到的片段映射到用于去标识化的隐私相关标签。GLiNER2等通用系统可以将这些标签视为请求的提取模式,而OpenMed-PII和OpenAI隐私过滤器等专用系统则专门设计用于PII检测[17 (https://arxiv.org/html/2609.12544#bib.bib17),18 (https://arxiv.org/html/2609.12544#bib.bib18),19 (https://arxiv.org/html/2609.12544#bib.bib19)]。OpenAI隐私过滤器使用双向标记分类和基于固定隐私标签分类法的片段解码[19 (https://arxiv.org/html/2609.12544#bib.bib19)]。这种公式化将上下文标记表示与显式实体边界预测相结合。遵循这种方法,我们使用BIOES标记和我们的九标签PII本体在 Meddies-PII 数据集上训练了 Meddies-PII 模型。

## 3 Meddies-PII 数据集  
### 3.1 概述  
人工标注的PII数据集提供用于训练和评估的专家审核标签,但其成本限制了它们的规模、语言覆盖范围和领域多样性[8 (https://arxiv.org/html/2609.12544#bib.bib8),2 (https://arxiv.org/html/2609.12544#bib.bib2)]。合成生成提供了更大的可扩展性,尽管控制不足和验证程序未充分记录可能使现有数据集难以复现[5 (https://arxiv.org/html/2609.12544#bib.bib5),6 (https://arxiv.org/html/2609.12544#bib.bib6),7 (https://arxiv.org/html/2609.12544#bib.bib7)]。Meddies-PII 数据集通过一个多语言生成框架解决了这一权衡问题,该框架使其生成属性和确定性验证过程变得明确。图1 (https://arxiv.org/html/2609.12544#S3.F1) 提供了完整管道的概述。参考标题图1:用于创建 Meddies-PII 数据集的合成数据生成和验证管道。  
#### 数据集组成  
| 英语 | 越南语 | 其他十五种语言(各占4.19%) |
| :--- | :--- | :--- |
| 25.55% | 11.55% | 62.90% |

图2:Meddies-PII 数据集的语言分布。其他十五种语言各包含41,934个样本(4.19%)。  

Meddies-PII 数据集包含一百万份跨越十七种语言的合成文档:英语、越南语、中文、日语、老挝语、泰米尔语、泰语、缅甸语、菲律宾语、俄语、西班牙语、马来语、印尼语、葡萄牙语、法语、韩语和德语。在生成初始集合后,我们审查了其样本,并确定了提高数据质量的机会。然后我们完善了生成过程,并创建了第二个包含更高质量样本的集合。最终数据集从两个集合中混合选定的样本以达到一百万份文档,同时保持目标语言分布和更广泛的覆盖范围。这种设计与样本级预训练数据混合研究一致,该研究在确定最终数据分布时同时考虑质量和多样性[20 (https://arxiv.org/html/2609.12544#bib.bib20)]。语言选择强调东南亚语言,其中一些在现有PII数据集中代表性不足。由于国际广泛使用的语言也在东南亚国家使用,我们通过该地区以外的重要语言扩展了数据集,从而覆盖了不同的文字系统、语言家族和资源水平。图2 (https://arxiv.org/html/2609.12544#S3.F2) 总结了语言分布。  

#### PII 标签  
我们定义了一个九标签PII本体,参考了ISO/IEC 29100:2024 [21 (https://arxiv.org/html/2609.12544#bib.bib21)] 中描述的标识符和区分属性:  
- • 地址:街道地址、邮政编码、坐标和护理地点;  
- • 公司名称:医院、诊所、部门、公司和其他组织;  
- • 日期:出生日期、入院和出院日期以及与个人或就诊相关的其他特定日期时间;  
- • 电子邮箱地址;  
- • 人名:患者、临床医生和其他人名;  
- • 身份证号:医疗记录号、政府标识符、护照和驾照号码、IP地址和账号;  
- • 电话号码:电话和传真号码;  
- • 私有URL:包含访问权限的患者门户、结果、已签署或私有记录URL;  
- • 密码:密码、API密钥、认证或会话令牌、Cookie、个人识别码和一次性密码。  

#### Meddies-PII 基准测试  
我们的基准测试包含5100份经过验证的文档,均匀分布在十七种语言中,每种语言300份。对于每种语言,100份文档评估标准条件下的PII提取,而200份则强调对抗性表面形式。每份对抗性文档结合了十三种扰动技术中的四到五种。这些技术包括口语数字和电子邮件符号、语音拼写、不寻常的间距、实体内换行符、截断、部分遮蔽、类OCR替换、Unicode混淆字符和拼接值。这些扰动在保留已标注PII片段的同时,测试了对语音转录、扫描记录、消息和管理文档中常见噪声的鲁棒性。

### 3.2 数据集创建  
如图1 (https://arxiv.org/html/2609.12544#S3.F1) 所示,数据集创建分三个阶段进行:准备、生成和验证。对于每个样本,框架准备一个受控提示,将其发送到生成池中的一个模型,并在将生成的文档纳入数据集之前对其进行验证。  

#### 阶段1:准备  
每个生成提示结合了六个属性组,以控制样本的内容和结构。医疗文档决定工作流程和内容,而文本格式决定这些内容的表达方式。通用规则维护标注一致性,而场景控制操作上下文和难度。这些组共同捕获了临床PII数据中互补的变异来源。随机组合属性值可大规模产生多样化的提示,这种方法得到了以下证据的支持:属性提示可提高合成数据的多样性和下游性能,同时降低查询成本[22 (https://arxiv.org/html/2609.12544#bib.bib22)]。我们通过项目讨论优化了最终选项集,以平衡现实的临床和管理用例与广泛的标签和结构覆盖范围。图3.2 (https://arxiv.org/html/2609.12544#S3.SS2.SSS0.Px1) 显示了提示模板。  
1. 语言:指定生成文档的目标语言。  
2. PII标签:九个标签指定每个文档的PII类别和所需标签覆盖范围。  
3. 医疗文档:代表常见临床和管理工作流程中的PII。十二种文档包括:出院小结;门诊记录;实验室结果通知;患者门户访问日志;保险索赔说明;转诊信;药房续方请求;预约提醒;远程医疗分诊记录;医疗账单或发票;类FHIR的患者和就诊资源;以及HL7风格的入院或更新消息。  
4. 文本格式:捕获等效信息如何在散文、结构化记录、日志、转录和噪声文本中变化。十一种格式是:普通临床笔记;Markdown章节;杂乱的护士或管理笔记;类似表格的行;类似JSON的对象;类FHIR JSON;类HL7的管道分隔文本;患者门户审计日志;语音转录文本;轻微退化的OCR文本;以及临床对话转录。  
5. 通用规则:在属性组合中保持一致的生成和标注。五组规则管理输出格式、电话号码构建、私有URL、密码以及医疗文档与文本格式之间的兼容性。  
6. 场景:将PII置于现实的操作上下文中,同时控制标签密度和难度。十二种场景是:所有标签密集;私有门户密码聚焦;对抗性混淆;公开负面对比;结构化载荷;通用消费者管理支持;人力资源、雇主、学校、保险或电信管理;代码、日志、安全或账户恢复;对抗性格式化;结构化通用载荷;一跳延迟线索;以及公开负面URL和数据对比。  

[⬇](data:text/plain;base64,dXNlcl9wcm9tcHQgPSBmIiIiCkdlbmVyYXRlIG9uZSBzeW50aGV0aWMge2xhbmd1YWdlfSB7ZG9jdW1lbnRfdHlwZX0gaW4ge3RleHRfZm9ybWF0fSBmb3JtYXQuCgpTY2VuYX

相似文章