机构特定的LLM提示恢复去标识化系统及其金标准均遗漏的PHI

arXiv cs.CL 论文

摘要

本研究证明,使用机构特定提示的大型语言模型能够恢复现有去标识化系统遗漏的受保护健康信息,从而增强电子健康记录中的数据隐私合规性。

arXiv:2608.17051v1 公告类型:新 摘要:电子健康记录的二次使用需要去标识化,但现有系统遗漏了\emph{机构特定的}受保护健康信息(PHI),例如医院缩写、建筑名称和内部代码,这些信息的性质由本地确定。我们探讨大型语言模型(LLMs)结合上下文学习(ICL)能否弥补这一差距并控制精确率-召回率的权衡。 在来自德州儿童医院的100份标注的儿科肿瘤学笔记(5,322个PHI区间)上,我们基准测试了八个LLM,对比两个专用系统(Stanford TiDE、OpenMed PII)和两个基于模式的基线。每个LLM在三个特异性递增的提示下运行:(1)符合HIPAA标准的基线,(2)基线加上其遗漏的机构PHI类别,(3)提示2加上避免过度编辑临床内容的指令。随后,我们比较了14个多智能体和集成配置与最佳单一提示,以召回率作为主要安全指标。 LLMs优于专用系统(最佳F1=0.918$\pm$0.001 对比 TiDE 0.779),优势集中在上下文类别中。命名遗漏类别恢复了79%(48/61)的类别,而避免过度编辑则恢复了精确率。没有智能体架构超越校准的单次提示(F1 0.906--0.907),但LLM输出揭示了414个候选标注缺口;重新标注确认了227个PHI区间,基于此,最终提示达到了召回率=0.981(F1=0.907$\pm$0.002)。 校准良好的ICL在每次笔记的单次LLM调用中解决了机构PHI差距和精确率-召回率权衡问题。LLMs运行成本高于传统方法,但该成本提供了审计参考标准的途径。 LLMs是专用去标识化系统的合法、可适应替代方案;机构特定提示开发应是主要适应策略。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:46

# 机构特定的LLM提示恢复了去标识化系统及其金标准均遗漏的PHI
来源:https://arxiv.org/html/2608.17051
机构特定的LLM提示恢复了去标识化系统及其金标准均遗漏的PHI

文章类型:研究与应用

作者\.Daniel Palacios, BS1,2,3,4,†\\dagger, Matthew Brady Neeley, BS1,2,3,4,†\\dagger, Angel Adetomike Otto, MS5, Shalini Dhamodharan, MS5, John P\. Woodhouse, BA5, Chi\-fan Lin, MS5, Mark Zobeck, MD, MPH5,∗\*, Zhandong Liu, PhD1,2,3,4,∗\*, Hyun\-Hwan Jeong, PhD2,3,4,∗\*\.

†\\dagger这些作者贡献相同。∗\*共同通讯作者。

机构\.

1\.贝勒医学院定量与计算生物科学系,美国德克萨斯州休斯顿

2\.贝勒医学院儿科系,美国德克萨斯州休斯顿

3\.德克萨斯儿童医院Jan and Dan Duncan神经研究所,美国德克萨斯州休斯顿 77030

4\.德克萨斯儿童医院数据中心,美国德克萨斯州休斯顿 77030

5\.贝勒医学院儿科系血液肿瘤科,美国德克萨斯州休斯顿

通讯作者\.Hyun\-Hwan Jeong,贝勒医学院儿科系及德克萨斯儿童医院Jan and Dan Duncan神经研究所,地址:1250 Moursund Street, Houston, TX 77030, USA。电话:+1 832\-824\-1000, ext\. 25535。邮箱:hyun\-hwan\.jeong@bcm\.edu\。

关键词:数据匿名化;电子健康记录;自然语言处理;机器学习;大型语言模型\。

字数\.摘要:239。正文:3,808。表格:1。图表:4\。

## 摘要

目的\.电子健康记录的二次使用需要进行去标识化,但现有系统会遗漏*机构情境下的*受保护健康信息(PHI):例如医院缩写和建筑物名称等标识符,其状态由本地决定。我们评估了大型语言模型(LLMs)是否能通过上下文内学习来弥合这一差距,同时控制精确率和召回率。

材料与方法\.在100份经过标注的儿科肿瘤学笔记(5,322个PHI文本段)上,我们基准测试了八个LLM与两个专用系统(Stanford TiDE, OpenMed PII)和两个基于模式的基线。每个LLM在三种提示模式下运行:*基线*(符合HIPAA标准)、*针对性*(增加机构PHI类别)和*精确*(增加防止过度编辑的指令)。我们还比较了14个多智能体和集成配置。召回率是主要的安全指标。

结果\.LLMs优于专用系统(最佳F1=0.918±0.001,Sonnet 4.6,对比TiDE的0.779),优势集中在上下文类别。明确指出遗漏的类别恢复了79%(48/61),而*精确*模式恢复了精确率。没有智能体架构优于单次提示(F1 0.906–0.908)。LLMs还编辑了414个金标准中缺失的标识符,被评为假阳性;对其中49个的专家审查确认全部为真实PHI,并重新标注了10份差异最大的笔记(+227个文本段),将*精确*模式的召回率提升至0.981(F1=0.907±0.002)。

讨论\.明确指出机构自身的标识符并警告过度编辑,可以通过对每份笔记进行一次LLM调用,同时解决机构PHI缺口和精确率-召回率权衡问题。LLMs可能成本更高,但这购买了一种审计金标准的方法。

结论\.LLMs是专用去标识化系统的可适应替代方案;机构特定的提示开发应是主要的适配方式。

## 引言

电子健康记录(EHRs)的二次使用需要在HIPAA安全港标准下对受保护健康信息(PHI)进行去标识化,该标准指定了18个标识符类别\[40 (https://arxiv.org/html/2608.17051#bib.bib4),28 (https://arxiv.org/html/2608.17051#bib.bib5)\]。这些定义了*规范*PHI(姓名、日期、医疗记录号、地理数据),模型可以从通用语言模式中识别这些信息。真实的临床笔记还包含*机构情境下的*PHI:其状态取决于本地机构上下文的标识符,包括医院缩写(如“TCH”代表德克萨斯儿童医院)、建筑物名称(“Mark Wallace Tower”)、内部诊所代码以及机构特有的服务提供者命名惯例。尽管未被列举在18个类别中,但根据安全港兜底条款“任何其他唯一识别号、特征或代码”(45 CFR §164.514(b)(2)(i)(R) (https://www.ecfr.gov/current/title-45/section-164.514))和专家判定标准(§164.514(b)(1) (https://www.ecfr.gov/current/title-45/section-164.514))\[28 (https://arxiv.org/html/2608.17051#bib.bib5),41 (https://arxiv.org/html/2608.17051#bib.bib6)\],它们属于HIPAA对PHI的定义范畴:在一个儿科肿瘤学人群中,一个命名的专科设施、一个罕见的诊断和服务日期,即使在所有规范标识符被移除后,也可以共同重新识别出记录。每个元素都具有独立的重新识别性:患者就诊的设施集合本身就是一个特征\[23 (https://arxiv.org/html/2608.17051#bib.bib24),37 (https://arxiv.org/html/2608.17051#bib.bib27)\],仅凭诊断代码就可能侵犯隐私\[22 (https://arxiv.org/html/2608.17051#bib.bib25)\];在华盛顿州的出院数据中,包含医院、诊断和主治医生但无姓名或地址,新闻报道唯一匹配了81名命名患者中的35名与其记录\[38 (https://arxiv.org/html/2608.17051#bib.bib26)\]。移除是一项监管要求,而非可选优化。

仅基于HIPAA的18个类别进行提示的模型,没有依据去识别“TCH”是一个标识性缩写,或者一个四位数的寻呼机号码是一个员工标识符。这些失败并非能力问题,而是*规范*问题:模型从未被告知这些需要被编辑。OCR指南预见了这一点,警告称仅被受覆盖实体少数员工知晓的缩写等晦涩标记,可能导致不必要的编辑或未能编辑\[28 (https://arxiv.org/html/2608.17051#bib.bib5)\]。规范也无法一劳永逸地编写和重用,因为笔记模板、缩写和患者人群因机构而异\[27 (https://arxiv.org/html/2608.17051#bib.bib35)\]:退伍军人健康管理局的笔记需要针对机构特定格式进行定制\[12 (https://arxiv.org/html/2608.17051#bib.bib16),24 (https://arxiv.org/html/2608.17051#bib.bib37)\],跨机构评估报告在迁移时性能持续下降\[46 (https://arxiv.org/html/2608.17051#bib.bib42)\]。在儿科环境中,这一差距尤为突出,因为大型多学科团队撰写的笔记会引用护理人员并带有机构缩写。

最近的工作开始将机构级标识符作为独立的标注类别进行隔离,特别是SHIELD的*医院*类别——一个用于临床去标识化的最新教师-学生蒸馏框架——其教师和学生模型在该类别上记录了最低的精确率\[33 (https://arxiv.org/html/2608.17051#bib.bib21)\]。之前的研究尚未表征这些标识符*为何*失败,也未证明通过规范而非重新训练可以补救这种失败。自动去标识化已从基于规则的系统\[36 (https://arxiv.org/html/2608.17051#bib.bib7),26 (https://arxiv.org/html/2608.17051#bib.bib8)\],发展到神经序列模型\[11 (https://arxiv.org/html/2608.17051#bib.bib9),20 (https://arxiv.org/html/2608.17051#bib.bib10)\],再到基于Transformer的命名实体识别\[19 (https://arxiv.org/html/2608.17051#bib.bib11),2 (https://arxiv.org/html/2608.17051#bib.bib12),31 (https://arxiv.org/html/2608.17051#bib.bib3)\],并在i2b2/UTHealth共享任务上进行基准测试\[35 (https://arxiv.org/html/2608.17051#bib.bib13),42 (https://arxiv.org/html/2608.17051#bib.bib14)\]。两个专用系统构成了我们比较的基础:OpenMed的领域自适应NER\[30 (https://arxiv.org/html/2608.17051#bib.bib28)\]和Stanford的TiDE,它结合了NER、模式匹配和已知PHI查找\[10 (https://arxiv.org/html/2608.17051#bib.bib23),6 (https://arxiv.org/html/2608.17051#bib.bib39)\]以及“隐藏在显眼处”代理\[7 (https://arxiv.org/html/2608.17051#bib.bib30)\]。

大型语言模型(LLMs)在成人临床基准测试中与传统NER系统相比具有竞争力或更优\[21 (https://arxiv.org/html/2608.17051#bib.bib15)\]。与此项工作最接近的是,Wiest等人\[44 (https://arxiv.org/html/2608.17051#bib.bib41)\]在250份临床信件上对八个本地LLM进行了基准测试,报告了在不同语言和笔记类型中约∼99.2%的PHI移除率;Altalla’等人\[3 (https://arxiv.org/html/2608.17051#bib.bib32)\]评估了GPT-3.5和GPT-4(P≈0.99, R≈0.83),Pissarra等人\[32 (https://arxiv.org/html/2608.17051#bib.bib33)\]发现LLMs与Presidio基线互补。多智能体架构也得到了探索:TEAM-PHI\[45 (https://arxiv.org/html/2608.17051#bib.bib18)\]使用多数投票的*评估*智能体对去标识化模型进行排名,且不使用金标准标签;OEMA\[39 (https://arxiv.org/html/2608.17051#bib.bib19)\]使用三个智能体进行零样本临床NER;SHIELD\[33 (https://arxiv.org/html/2608.17051#bib.bib21),15 (https://arxiv.org/html/2608.17051#bib.bib22),16 (https://arxiv.org/html/2608.17051#bib.bib34)\]选择教师标注器蒸馏到可本地部署的学生模型\[34 (https://arxiv.org/html/2608.17051#bib.bib1)\]。证明者-验证者框架\[17 (https://arxiv.org/html/2608.17051#bib.bib17)\]为先生成后验证的架构提供了理论依据,但尚未在去标识化中进行测试。

第二个挑战是精确率-召回率的权衡\[5 (https://arxiv.org/html/2608.17051#bib.bib36)\]。去标识化长期以来更重视召回率,因为遗漏一个标识符就是隐私泄露,而过度编辑只是移除了临床内容\[35 (https://arxiv.org/html/2608.17051#bib.bib13),13 (https://arxiv.org/html/2608.17051#bib.bib38)\]。在单次LLM调用中,这种权衡的独特之处在于其*幅度*和*模型依赖性*:没有单一的提示能在所有模型上同时优化这两个目标,有些模型过度编辑严重到降低了数据效用,而标准指标无法捕捉这种影响\[1 (https://arxiv.org/html/2608.17051#bib.bib2)\]。相反,基于LLM的对抗性重新识别\[25 (https://arxiv.org/html/2608.17051#bib.bib20)\]表明,即使是强大的系统也使笔记面临脆弱性。

我们假设限制去标识化的是*规范*而非模型能力:在上下文中明确指出机构自身的标识符,将能同时解决机构PHI缺口和精确率-召回率权衡问题。我们通过竞争性解释——即这种权衡需要架构性补救——来检验这一假设,使用了源自证明者-验证者范式\[17 (https://arxiv.org/html/2608.17051#bib.bib17)\]和多智能体临床NLP\[45 (https://arxiv.org/html/2608.17051#bib.bib18)\]的双次处理和“清洁工-审计员”管道(补充说明3)。我们做出了三项贡献。第一,在100份专家标注的儿科肿瘤学笔记(5,322个PHI文本段)上,对8个LLM与两个专用系统(Stanford TiDE, OpenMed PII)、基于模式的基线和多阶段管道进行基准测试,我们引入*机构情境下的*PHI作为所有系统的常见故障模式。第二,上下文内学习无需微调即可适配去标识化:明确指出遗漏的类别可恢复大部分,反过度编辑指令恢复精确率,而错误分析揭示了金标准缺口,经专家重新标注确认为真实PHI。第三,权衡在单次处理中解决:没有智能体架构在F1上优于它,从而将瓶颈定位在规范而非推理时计算。

## 方法

### 研究设计和临床语料库

我们对表1 (https://arxiv.org/html/2608.17051#Sx2.T1)中列出的LLMs和专用系统,以及两个基于模式的基线(仅正则表达式,以及spaCy NER + 正则表达式),在100份儿科肿瘤学临床笔记上进行了基准测试,LLMs在以下三种提示条件下运行。没有模型经过训练或微调。报告遵循TRIPOD-LLM\[14 (https://arxiv.org/html/2608.17051#bib.bib47)\];表S1和S2提供了逐项遵循表。

临床笔记语料库\.我们的语料库包含来自德克萨斯儿童医院(美国德克萨斯州休斯顿;96名患者)儿科肿瘤科的100份英文临床笔记,在固定种子下,通过伪随机排序从2021年1月1日及之后日期的笔记中抽取,未分层。笔记长度从91到32,767个字符不等(中位数,6,504;平均数,10,058),五份因导出限制而被截断。三位临床标注员,在儿科肿瘤学家和信息学家的培训下,识别18个安全港类别和机构情境下的标识符,标注了97份笔记中的5,322个PHI文本段(3份不含PHI),与肿瘤学家和法规人员共同解决疑问;由于标注遵循共识裁定而非独立双重标注,未计算一致性统计。图1 (https://arxiv.org/html/2608.17051#Sx11.F1)C显示了类别分布(补充说明1.1)。

验证数据集\.为检查我们的发现是否非语料库特有,我们还对来自USDHUB存储库的49份笔记(409个金标准PHI文本段)评估了所有系统,该存储库是一个独立策划的、来自同一机构的儿科神经学样本,由不同团队独立去标识化,使用相同的*基线*提示和评分管道(补充说明4)。由于USDHUB是为TiDE构建的,并附带患者特定配置材料,TiDE在两种括号配置下运行:完全未配置(与LLMs条件相同)和使用提供的已知PHI字典和每份笔记标识符标题进行最大配置。仅对于配置运行,精确率和F1在笔记正文上评分,因为注入的标题不包含金标准文本段(补充说明4.1)。

### 去标识化系统

LLM模型\.我们通过AWS Bedrock的Converse API评估了八个LLM(表1 (https://arxiv.org/html/2608.17051#Sx2.T1)),温度=0.0(除了Opus 4.8,它不通过Bedrock接受该参数;补充说明3.3),最大输出令牌=65,000,并最多重试3次,采用指数退避策略。为清晰起见,正文图表展示了按*基线*F1排名的前4个LLM(Sonnet 4.6, Opus 4.8, GLM-5, DeepSeek V3.2);所有八个模型均出现在表S3-S6中。

表1:评估的LLM和专用系统。两个基于模式的基线(仅正则表达式;spaCy NER + 正则表达式)在文中说明,并包含在所有报告的比较中。
系统类型族参数Claude Opus 4.8LLMAnthropic未公开Claude Sonnet 4.6LLMAnthropic未公开GPT-oss-120BLLMOpenAI120BGPT-oss-20BLLMOpenAI20BGLM-5LLM智谱AI754BKimi K2.5LLM月之暗面1.1TMiniMax M2.5LLMMiniMax229BDeepSeek V3.2LLM深度求索685BStanford TiDENER + 规则Stanford NLP—OpenMed PIINER(令牌分类)OpenMed434M
Stanford TiDE\.TiDE\[10 (https://arxiv.org/html/2608.17051#bib.bib23)\]是一个生产系统,通过NER、正则表达式和针对每个患者提供的真实标识符列表进行已知PHI匹配来检测PHI。由于LLMs和OpenMed从未接收该列表,为保证输入对等性,要求仅在笔记文本上运行TiDE,并禁用已知PHI匹配,使字段查找未找到行,而NER和正则表达式正常运行。这低估了TiDE的生产性能,但将上下文推理与模式匹配隔离开来(补充说明4.1)。

OpenMed PII\.我们使用了OpenMed-PII-SuperClinical-Large-434M-v1\[30 (https://arxiv.org/html/2608.17051#bib.bib28)\],这是一个针对医疗文本进行领域自适应的NER模型,基于BERT架构,参数量为434M,在广泛的PHI类别上进行训练。

相似文章

保护临床基础模型中的患者隐私:技术与法律视角

arXiv cs.AI

本文审视了临床基础模型中的隐私风险,其中模型介导的泄露即使在去标识化处理后仍可能导致患者重新识别。我们提出了一个实用的风险评估框架,并将现实中的泄露场景映射到HIPAA和GDPR等法律体系,提供了技术与法律相结合的综合缓解措施。