MedDeID 实现了基于真实或合成训练数据的本地化临床文本去标识化
摘要
MedDeID 是一个本地部署的框架,用于使用真实或合成训练数据对临床文本进行去标识化,在检测个人身份信息方面实现了高准确率,同时最小化过度编辑。
arXiv:2609.10049v1 Announce Type: new
摘要:临床笔记包含个人身份信息 (PII),限制了其在研究和医疗AI中的再利用,尤其是在数据不能离开机构的情况下。我们开发了MedDeID,一个本地部署的框架,结合内部标注和合成笔记生成与模型训练、推理、假名化和评估。在一个独立标注和裁决的300条荷兰医院基准笔记上,医院训练的紧凑型Transformer检测到98.9%的标识文本,同时仅编辑了0.24%的非标注标识符文本;仅合成数据对应的模型检测到96.1%。在100条初级保健笔记上,合成数据训练的模型实现了比医院训练模型更高的召回率(90.3%对87.0%),并且对标识符格式扰动具有更强的鲁棒性。一个未使用真实文本训练的英语实例在两个外部合成基准上检测到99.7%和98.9%的标注标识符字符。这些结果证明了工作流程向另一种语言的迁移,但未证明临床英语性能。MedDeID提供了一种使用真实或合成训练数据进行本地化管理的去标识化途径。
查看缓存全文
缓存时间: 2026/09/10 08:18
# MedDeID:利用真实或合成训练数据实现本地化管控的临床文本去标识化 来源:https://arxiv.org/html/2609.10049 作者:Stig Hellemans<sup>1,3,*</sup>, Tom Stroobants<sup>2,3</sup>, Elyne Scheurwegs<sup>3</sup>, Pieter Meysman<sup>1</sup>, Philippe G. Jorens<sup>2,3</sup>, Kris Laukens<sup>1</sup> 所属机构: 1. 安特卫普大学计算机科学系,Adrem 数据实验室,安特卫普,比利时 2. 安特卫普大学实验医学与儿科学实验室 (LEMP),安特卫普,比利时 3. 安特卫普大学医院 (UZA),埃德海姆,比利时 *通讯邮箱:[email protected] ### 摘要 临床笔记包含个人身份信息 (PII),这限制了其在研究和医学人工智能领域的再利用,尤其当数据无法离开机构时。我们开发了 MedDeID,这是一个本地化框架,结合了内部标注、合成笔记生成以及模型训练、推理、假名化和评估。在由300篇荷兰语医院笔记组成的独立标注、仲裁基准测试中,医院训练的紧凑型Transformer模型检测出98.9%的标识文本,同时错误遮蔽了0.24%未被标注的标识符之外的文本;而仅使用合成数据训练的模型检测出96.1%。在100篇初级保健笔记上,合成数据训练的模型召回率高于医院训练模型(90.3% vs. 87.0%),并且对标识符格式扰动表现出更强的鲁棒性。一个未经真实文本训练的英文实例,在两个外部合成基准测试中分别检测出99.7%和98.9%的标注标识符字符。这些结果证明了该工作流程向其他语言迁移的可行性,但尚未确立其在真实临床英语中的性能。MedDeID 为使用真实或合成训练数据进行本地化管控的去标识化提供了一条路径。 ### 引言 电子健康记录中的非结构化自由文本——入院记录、出院信、进展笔记、会诊报告——是临床医生记录推理过程、病史和细微差别的地方,而这些是结构化字段无法捕捉的。因此,它是临床研究以及开发和评估医学人工智能<sup>1</sup> (https://arxiv.org/html/2609.10049#bib.bib1) 最宝贵的素材之一。此外,它充满了个人身份信息 (PII)。根据欧盟《通用数据保护条例》,为科学研究处理健康数据需要合法依据、适用的第9条条件以及适当的技术和组织保障措施。第89条特别要求对研究提供保障,包括数据最小化,并在可行的情况下进行假名化<sup>2</sup> (https://arxiv.org/html/2609.10049#bib.bib2),<sup>3</sup> (https://arxiv.org/html/2609.10049#bib.bib3)。在美国,《HIPAA隐私规则》提供了安全港和专家认定两种去标识化途径<sup>5</sup> (https://arxiv.org/html/2609.10049#as1_bib.bib5)。因此,去标识化是临床自由文本二次利用的关键保障措施。这项任务不仅仅是移除明显的标识符:直接标识符(如患者姓名)和间接(或准)标识符(如年龄、邮政编码或入院日期)都可能揭示个人身份,因此也包含在内<sup>3</sup> (https://arxiv.org/html/2609.10049#bib.bib3),<sup>5</sup> (https://arxiv.org/html/2609.10049#bib.bib5)。 英语系统已达到基准成熟度和生产规模。i2b2/UTHealth共享任务为受保护健康信息 (PHI) 建立了共享词汇表<sup>6</sup> (https://arxiv.org/html/2609.10049#bib.bib6),<sup>7</sup> (https://arxiv.org/html/2609.10049#bib.bib7);神经序列模型将实体级F1值推高至百分之九十几<sup>8</sup> (https://arxiv.org/html/2609.10049#bib.bib8),<sup>9</sup> (https://arxiv.org/html/2609.10049#bib.bib9),<sup>10</sup> (https://arxiv.org/html/2609.10049#bib.bib10);而Philter,一个开源的基于规则的系统<sup>11</sup> (https://arxiv.org/html/2609.10049#bib.bib11),随后通过了外部审计认证,并在加州大学旧金山分校扩大应用,将超过1.3亿份去标识化笔记(来自275万患者)交给了600多名研究人员,无需进一步的伦理审查<sup>12</sup> (https://arxiv.org/html/2609.10049#bib.bib12)。该审计发现,在17个非日期HIPAA类别中均未发现残留标识符,并估计少于0.025%的患者面临因日期偏移而被重新识别的风险<sup>12</sup> (https://arxiv.org/html/2609.10049#bib.bib12)。Philter是可部署、开放可用的去标识化系统所能实现目标的典范<sup>11</sup> (https://arxiv.org/html/2609.10049#bib.bib11)。 荷兰语和弗拉芒语临床文本的情况,乃至大多数非英语环境的情况,与此大相径庭,这种差距不仅仅是努力程度的问题。去标识化本质上具有语言特异性:标识符的表达依赖于语言相关的模式,包括本地词汇、姓名形态、日期和地址惯例以及临床文档的简写风格,这些都限制了为其他语言开发的方法的可迁移性。主要的基于规则的荷兰语工具DEDUCE是为单一机构精心手工构建的,并在该机构实现了高召回率<sup>13</sup> (https://arxiv.org/html/2609.10049#bib.bib13),但这类规则系统的泛化能力较差:Trienes等人证明,现有的荷兰语基于规则的方法在新数据上失败,而最先进的神经网络架构则能够跨机构、跨领域泛化,且配置工作量少得多<sup>14</sup> (https://arxiv.org/html/2609.10049#bib.bib14),2025年的一项复制研究也证实了这些工具在不同场景下的变异性<sup>15</sup> (https://arxiv.org/html/2609.10049#bib.bib15)。荷兰语临床语言模型——在真实医院笔记上预训练的MedRoBERTa.nl和通用RobBERT系列——为紧凑的荷兰语去标识化器提供了实用的编码器骨干<sup>16</sup> (https://arxiv.org/html/2609.10049#bib.bib16),<sup>17</sup> (https://arxiv.org/html/2609.10049#bib.bib17),<sup>8</sup> (https://arxiv.org/html/2609.10049#as1_bib.bib8)。 与此同时,一波将生成式大语言模型应用于去标识化的工作在有利条件下取得了令人印象深刻的召回率<sup>19</sup> (https://arxiv.org/html/2609.10049#bib.bib19),<sup>20</sup> (https://arxiv.org/html/2609.10049#bib.bib20),<sup>21</sup> (https://arxiv.org/html/2609.10049#bib.bib21),<sup>22</sup> (https://arxiv.org/html/2609.10049#bib.bib22),<sup>23</sup> (https://arxiv.org/html/2609.10049#bib.bib23),<sup>24</sup> (https://arxiv.org/html/2609.10049#bib.bib24);然而,本文评估的大语言模型明显慢于紧凑的本地模型,并且对于真实笔记的结构化格式仍然脆弱。 另外两个差距加剧了第一个问题。荷兰语临床去标识化的公开真实数据基准测试仍然不可用,因此各团队在无法访问的本地语料库上进行评估,独立复现困难<sup>25</sup> (https://arxiv.org/html/2609.10049#bib.bib25)。合成预训练、多样性感知的数据构建和教师-学生蒸馏正成为解决英语和法语中同样瓶颈的途径<sup>26</sup> (https://arxiv.org/html/2609.10049#bib.bib26),<sup>27</sup> (https://arxiv.org/html/2609.10049#bib.bib27),但其效益取决于训练方案和评估领域。现有系统也常常止步于检测,忽略了医疗机构对假名化的需求:日期必须偏移以保留临床时序,年龄必须降级到仍然具有临床意义的最粗粒度。例如,将一个两个月大的婴儿简化为“0岁”,会破坏儿科医生所需的信息,并在重新识别风险和临床价值之间造成了不必要的权衡。 本研究针对跨语言和临床环境的三个挑战:去标识化系统迁移能力差、共享临床文本用于模型开发和评估的限制、以及假名化过程中有用信息的丢失。MedDeID 通过一个可本地部署的工作流程来应对,该流程支持基于本地标注或合成笔记进行训练、在可共享的合成基准上进行评估,以及具有临床意识的日期和年龄假名化。为了比较在真实荷兰语临床文本上使用真实数据和仅使用合成数据训练的效果,我们使用相同的紧凑架构训练了两个独立模型:一个在标注的医院笔记上训练,另一个仅在合成的荷兰语笔记上训练,并在留出的医院和初级保健笔记上评估两者。然后,我们重复使用MedDeID,仅使用合成英语数据训练一个独立的英文模型,以测试研究人员和医疗机构是否能将此框架适配到另一种语言,而不是重建整个工作流程。这并不涉及从荷兰语模型迁移,也未在真实英语临床文本上确立性能。在两种语言实例中,MedDeID使用通用的模式、字符偏移量、后处理、假名化规则和评估协议。核心PII召回率衡量的是检测到的真实标识符字符的百分比,而非PII遮蔽率衡量的是被移除的标注范围之外的临床文本比例。 ### 结果 #### 评估数据集与临床基准 表1总结了六个数据资源,分为九个不重叠的训练和评估分区。临床性能在两个真实的荷兰语基准上进行评估:一个留出的、独立标注和仲裁的医院数据集 (n=300) 和一个单独标注的初级保健数据集 (n=100)。荷兰语合成基准提供了对完整工作流程的可共享测试,而三个完全合成的英语基准则测试该工作流程是否能在另一种语言中复现;它们并未确立在真实英语临床文本上的性能<sup>28</sup> (https://arxiv.org/html/2609.10049#bib.bib28),<sup>29</sup> (https://arxiv.org/html/2609.10049#bib.bib29)。没有评估数据用于模型训练。医院和初级保健的金标准分别包含4,269和4,010个PII标注;所有六个基准的标注量、密度和映射类别组成对比见补充图S1。完整的数据、标注和评估流程见方法部分和补充章节S1-S3。 #### 在荷兰医院基准上的性能 我们在来自安特卫普大学医院 (UZA) 的4,470篇独立标注的开发笔记语料库上训练了 **meddeid-dutch-uza**。在300篇医院笔记的基准测试中,核心PII召回率为98.9% (98.5-99.3%;表2)。非PII遮蔽率为0.24% (0.16-0.32%)。该模型使用RobBERT-2023荷兰语编码器<sup>8</sup> (https://arxiv.org/html/2609.10049#as1_bib.bib8),采用双头结构分别处理词元级别的跨度边界和跨度标签,随后经过MedDeID的后处理层(图1)。标注员1的召回率为98.8%,非PII遮蔽率为0.17%;标注员2的召回率为98.5%,非PII遮蔽率为0.36%。因此,模型的召回率比标注员高0.1-0.4个百分点,而非PII遮蔽率介于两位标注员之间。这些数值将模型置于该基准上标注员观察到的范围内。由于标注员帮助创建了仲裁参考标准,此比较并不能证明模型优于或等同于医生。所有外部比较对象的表现都远远落后。我们升级后的比利时DEDUCE达到88.0%的召回率,先前发布的荷兰去标识化模型 **deidentify** 为86.4%<sup>14</sup> (https://arxiv.org/html/2609.10049#bib.bib14),本地部署的大语言模型 (Qwen3-8B)<sup>30</sup> (https://arxiv.org/html/2609.10049#bib.bib30) 为84.2%。一个用于个人身份信息 (PII) 的零样本NER模型 GLiNER-PII 达到76.6%<sup>31</sup> (https://arxiv.org/html/2609.10049#bib.bib31),原始荷兰语DEDUCE为75.9%<sup>13</sup> (https://arxiv.org/html/2609.10049#bib.bib13),两个通用神经PII检测器分别为72.1% (OpenAI) 和49.1% (OpenMed)。这些差异因标识符类别以及标注标识符跨度内的组成部分而异(补充表S5和图S2-S3)。 更高的召回率不需要过度遮蔽非PII文本。使用完整的MedDeID流程,**meddeid-dutch-uza** 在金标准范围外遮蔽了0.236%的字符,低于所有其他评估的模型,并介于两位标注员之间 (0.174-0.359%);作为对比,**deidentify** 遮蔽了0.558%(表2)。在 **meddeid-dutch-uza** 遮蔽的1,236个非PII字符中,有353个来自完全错误的检测。其余883个是检测到的PII边缘的多余字符。因此,大多数过度遮蔽反映的是跨度边界不精确,而非虚假检测(补充表S4a)。MedDeID流程还可以使用存储在笔记元数据中的患者和护理者姓名。这仅略微提高了医院训练模型的召回率 (98.8% 到 98.9%),但使比利时DEDUCE的召回率从78.5%提高到88.0%。由于元数据的可用性可能因机构而异,表S4a报告了包含和不包含此步骤的结果;所有正文结果均使用包含元数据的完整MedDeID流程。 #### 合成训练与跨场景性能 我们仅在合成文本上训练了 **meddeid-dutch-synth**,未使用真实患者数据(表1;方法)。在真实医院基准上,其核心PII召回率达到96.1%——比医院训练模型低2.8个百分点 (2.2-3.5),但高于我们测试的所有外部比较对象(表2)。对于无法构建标注语料库的机构,这为其本地部署和微调提供了一个开源的起点。我们在来自比利时一家初级保健诊所的100篇全科医生笔记上验证了所有系统,这些笔记由一位医师研究员根据相同指南进行标注和子标注。每个系统在初级保健基准上的核心PII召回率均低于医院基准(表2)。在这些笔记上,合成训练模型的召回率高于医院训练模型 (90.3% vs. 87.0%),差异为3.3个百分点 (1.7-5.2)。在神经网络系统中,医院到初级保健的最大差异出现在本地大语言模型上 (84.2% vs. 60.8%);原始DEDUCE分别达到75.9%和57.2%。在模型检测到的标识符跨度中,医院训练模型在医院笔记上正确分配标识符类别的比例为98.9%,在初级保健笔记上为89.8%。合成训练模型的相应值分别为92.6%和79.3%(补充表S6和图S4)。因此,在检测到跨度后,合成训练模型在两种护理环境中分配正确标识符类别的可靠性均低于医院训练模型。 非PII遮蔽在初级保健笔记上差异更为显著。OpenAI神经PII检测器在金标准范围外遮蔽了11.46%的字符,OpenMed检测器为8.25%,而医院训练模型为0.29%,**meddeid-dutch-synth** 为1.22%(表2)。补充图S10显示了这些被遮蔽字符在每个系统预测的PII类别中的分布情况。如此高的遮蔽率表明研究相关文本的大量丢失,这是仅比较召回率无法捕捉到的一种失败模式。在公开发布的合成基准上,**meddeid-dutch-synth** 达到99.8%的核心PII召回率 (99.5-100.0%),非PII遮蔽率为0.28% (0.21-0.35%)。医院训练模型在此集合上的召回率为96.6%,比其在医院数据上的结果低2.3个百分点。已发布的 **deidentify** 基线达到76.7%的核心PII召回率,非PII遮蔽率为0.37%,而Qwen3-8B达到90.9%的召回率,非PII遮蔽率为1.28%。因此,该基准提供了
相似文章
Meddies PII:用于临床文本的开源多语言去标识化模型
Meddies PII 是一个用于临床文本去标识化的开源多语言模型及数据集,旨在移除患者标识符的同时保留临床事实。它利用动态提示生成的合成数据,以处理多样化的真实世界格式。
OpenMed 1.8:Apache-2.0 临床去标识化工具,完全本地运行,现已支持 Android、iOS 和浏览器。400+ 开放议题邀你参与 1.9 版本
OpenMed 1.8 是一款 Apache-2.0 临床去标识化工具包,完全本地运行,新增对 Android、iOS 和浏览器平台的支持,并邀请社区为 1.9 版本贡献力量。
机构特定的LLM提示恢复去标识化系统及其金标准均遗漏的PHI
本研究证明,使用机构特定提示的大型语言模型能够恢复现有去标识化系统遗漏的受保护健康信息,从而增强电子健康记录中的数据隐私合规性。
MedDDC-Eval: 多轮医疗咨询智能体的诊断解耦评估
MedDDC-Eval引入了一个针对多轮医疗咨询智能体的诊断解耦评估测试平台,将策略引导的对话历史与诊断生成分离,以实现对证据获取和诊断有用性的更清晰测量。
移除还是保留?用于教育对话去标识化的全本地AI级联
本文提出了一种用于教育对话去标识化的全本地AI级联框架,结合了先召回候选生成器与上下文感知的移除/保留评审器。该方法在不将数据发送到外部API的情况下实现了高精度,在数学辅导记录上优于更小的本地模型和商业API。