Redakto - LLMs 的隐身标签
摘要
Redakto 是一个开源工具,旨在在将文本输入大型语言模型之前对其进行匿名化,通过 PII 编辑和假名化确保隐私,并进行了关于隐私和实用性的实证评估。
arXiv:2608.18260v1 公告类型:新
摘要:大型语言模型 (LLMs) 正在日常应用中日益普及。在使用 LLMs 或人工智能 (AI) 时,一个主要挑战是确保隐私,即从任何输入 LLM 的文本中移除个人身份信息 (PII)。随着新的欧盟法规,这些挑战变得更加紧迫。在欧盟国家,围绕 LLM 使用的隐私担忧可能会成为创新和从研究到应用转移速度的重大障碍。在这里,我们介绍 **Redakto**,一个可用于在将文本输入 LLM 或其他下游文本处理之前进行匿名化的工具。我们提供了最先进的功能,用于 PII 编辑以及用于假名化时使用。这些功能通过 Redakto Web 应用程序暴露给终端用户,并通过 REST API 和模型上下文协议 (MCP) 钩子暴露给开发者和研究人员。该实现完全开源,需要适度的计算资源,并且可以轻松部署在本地硬件上。与之前的工作相比,为了更好地评估匿名化文本的质量,我们对来自法律和医疗领域的文本数据进行了广泛的实证评估,涉及编辑文本的隐私和实用性。我们的实证结果表明,使用不同编辑策略匿名化的文本在实用性得分上与原始文本相当,这表明使用 Redakto 进行匿名化可以用于 LLM 任务,而不会对我们探索的任务产生重大负面影响。
查看缓存全文
缓存时间: 2026/08/20 10:04
# Redakto – LLM的隐身标签页
来源:https://arxiv.org/html/2608.18260
Saurav Kumar Saha OrcID:0009\-0002\-9812\-4150 (https://orcid.org/0009-0002-9812-4150)
隶属机构:柏林应用科学大学,Luxemburger街10号,13353柏林,德国
https://www.bht-berlin.de/
电子邮件:[\{sauravkumar\.saha,tom\.roehr,felix\.biessmann\}@bht\-berlin\.de](mailto:{sauravkumar.saha,tom.roehr,felix.biessmann}@bht-berlin.de)
Tom Röhr OrcID:0009\-0007\-7448\-8941 (https://orcid.org/0009-0007-7448-8941)
隶属机构:柏林应用科学大学,Luxemburger街10号,13353柏林,德国
https://www.bht-berlin.de/
电子邮件:[\{sauravkumar\.saha,tom\.roehr,felix\.biessmann\}@bht\-berlin\.de](mailto:{sauravkumar.saha,tom.roehr,felix.biessmann}@bht-berlin.de)
Felix Bießmann OrcID:0000\-0002\-3422\-1026 (https://orcid.org/0000-0002-3422-1026)
隶属机构:柏林应用科学大学,Luxemburger街10号,13353柏林,德国
https://www.bht-berlin.de/
电子邮件:[\{sauravkumar\.saha,tom\.roehr,felix\.biessmann\}@bht\-berlin\.de](mailto:{sauravkumar.saha,tom.roehr,felix.biessmann}@bht-berlin.de)
隶属机构:爱因斯坦数字未来中心,Wilhelmstraße街67号,10117柏林,德国
https://www.digital-future.berlin/
###### 摘要
大型语言模型(LLMs)正日益应用于日常场景。在LLM或广义人工智能(AI)领域,一个关键挑战是确保使用时的隐私安全,即从进入LLM的任何文本中移除个人身份信息(PII)。随着欧盟新法规的出台,这些挑战变得更加紧迫。在欧盟国家,围绕LLM使用的隐私不确定性可能严重阻碍创新速度及从研究到应用的转化。本文介绍Redakto,这是一个可在文本输入LLM或其他下游文本处理前进行匿名化的工具。我们不仅为PII编辑提供了最前沿的功能,也为假名化处理提供了同等水平的功能。这些功能通过Redakto Web应用程序向终端用户开放,并通过REST API和模型上下文协议(MCP)接口向开发者与研究人员开放。该实现完全开源,计算资源需求适中,可快速部署于本地硬件。与以往工作不同,为更好评估匿名化文本的质量,我们在法律和医疗领域的文本数据上进行了广泛的实证评估,考量了编辑后文本的隐私性和实用性。我们的实证结果表明,采用不同编辑策略匿名化的文本,其实用性评分与原始文本相当,这表明使用Redakto进行匿名化处理可用于LLM任务,且对我们探索的任务不会产生显著负面影响。
###### 关键词:
隐私保护自然语言处理 PII检测 文本匿名化 隐私-实用性权衡 GDPR合规性
## 1 引言
在大型语言模型(LLMs)正深刻变革文本处理与分析的时代,保护敏感信息的需求从未如此重要。尽管这些模型为研究和应用带来了巨大潜力,但无意间暴露个人身份信息(PII)的风险仍是其安全与合乎伦理使用的主要障碍。在公共管理、医疗保健或法律研究等需要分析机密文件的领域,这一挑战尤为突出。为了在这些领域及更广泛场景中推动更负责任的LLM使用,我们展示了一个新型软件演示器,它能自动检测并编辑文本中的PII,使用户能够自信地将净化后的内容共享给基于LLM的聊天机器人或其他对隐私敏感的下游应用。在先前匿名化实践工作的基础上,我们开发了评估协议,以评估不同编辑策略(如语义标签掩码、随机掩码等)在实用性方面的效果。我们在多种文本任务上的实验验证表明,我们的解决方案不仅保护了隐私,还能维持原始文本的完整性与实用性,为安全且负责任的AI辅助分析铺平了道路。总而言之,本研究的主要贡献如下:
- •Redakto Web应用程序及API(REST与MCP)
- •Redakto模型的隐私评估
- •编辑文本在下游任务中的实用性评估
## 2 Redakto Web应用程序与API
Redakto模型以三种不同方式暴露,以尽可能方便终端用户、开发者和研究人员使用。具体而言,我们提供了一个即用型Web应用程序,以及托管于机构计算基础设施上的REST API和模型上下文协议(MCP)服务器。所有组件均容器化,可自行托管(例如在Kubernetes集群上),且MCP服务器可集成到兼容MCP的LLM助手和智能体框架中,从而在自动化LLM工作流中实现隐私保护的编辑功能,而不仅仅是提示。关于Redakto系统设计与实现架构的简要概述见附录0.B(https://arxiv.org/html/2608.18260#Pt0.A2)。
### 2.1 Web应用程序
### 2.2 REST API
REST API端点在Redakto Web应用程序中通过Swagger UI文档化并暴露222https://redakto.demo.calgo-lab.de/api/docs。第一个主要端点在一个或多个输入文本上执行命名实体识别,第二个端点在此功能基础上额外生成输入文本的假名化版本。两个端点均支持粗粒度和细粒度的实体标注。
### 2.3 MCP服务器
我们还提供了一个MCP(模型上下文协议)服务器,以npm包形式分发333https://www.npmjs.com/package/@sksdotsauravs/redakto-app-mcp-server,将Redakto的功能暴露为结构化工具,供LLM助手和智能体框架使用。通过此接口,Claude等LLM助手可以调用预定义模式的工具调用进行实体检测和假名化,而无需仅依赖提示处理。这使得隐私感知的文本转换能够以编程方式集成到智能体工作流、开发者工具和交互式AI系统中。
## 3 隐私评估
本节我们定量评估匿名化性能。为展示Redakto匿名化能力的鲁棒性和领域泛化性,我们在三个来自不同领域的数据集上进行了实验:CodE Alltag(电子邮件)444https://github.com/codealltag/CodEAlltag、GraSCCo(临床文本)555https://zenodo.org/records/15747389 和 LER(法律文档)666https://huggingface.co/datasets/elenanereiss/german-ler。总之,为Redakto演示器优化的Transformer模型在具有丰富标注数据的领域(如CodE Alltag、LER)上训练时,PII检测的宏平均F1值达到≈0.95。对于低资源的临床GraSCCo语料库,性能较低,这与先前工作(如[2](https://arxiv.org/html/2608.18260#bib.bib9))一致,该工作报道在使用埃森大学医院数千份领域内临床文档(数据和模型均未公开)时,最高可达0.95的宏F1值,这突显了数据可用性、标注质量和实体覆盖范围(而非模型架构)是隐私感知命名实体识别(NER)的主要瓶颈。
### 3.1 CodE Alltag - 德语电子邮件文本
在先前使用CodE Alltag语料库进行德语文本PII检测和假名化工作的基础上[7](https://arxiv.org/html/2608.18260#bib.bib1), [4](https://arxiv.org/html/2608.18260#bib.bib2), [5](https://arxiv.org/html/2608.18260#bib.bib3), [6](https://arxiv.org/html/2608.18260#bib.bib4), [14](https://arxiv.org/html/2608.18260#bib.bib17),我们用更大量样本和更广泛的基于Transformer的模型架构扩展了个人身份信息(PII)检测实验。完整的CodE Alltag语料库包含约150万封电子邮件,代表了自然发生的PII在非正式和半正式通信中的多样实例。为获得稳健可靠的性能估计,我们采用5折交叉验证设置,在17.5万封电子邮件文本的子集上进行,训练-开发-测试集按60/20/20比例划分。关于训练设置、模型配置、评估协议和完整实验结果的更多细节请参见项目仓库777https://github.com/calgo-lab/redakt-codealltag。
表1:CodE Alltag上的PII检测性能
图1:GraSCCo上的PII检测性能
表2:LER上的PII检测性能
我们微调并比较了三个基于Transformer的模型,评估它们在德语电子邮件文本中检测14类PII的有效性。表1(https://arxiv.org/html/2608.18260#S3.T1)展示了测试集上宏平均性能的比较,包括五折交叉验证折叠上的均值和标准差。
### 3.2 GraSCCo - 德语临床文本
为研究德语临床文档中的PII检测,我们使用了Graz合成临床语料库(GraSCCo)[11](https://arxiv.org/html/2608.18260#bib.bib5), [10](https://arxiv.org/html/2608.18260#bib.bib6)。鉴于GraSCCo语料库规模较小(1,439个标注私有实体,覆盖19种PII标签类型),我们探索了迁移学习,使用先前在CodE Alltag语料库上微调的PII检测模型检查点。我们将任务特定分类头替换为预测GraSCCo PII标签,并在临床语料库上进一步微调模型。图1(https://arxiv.org/html/2608.18260#S3.F1)总结了所有模型在GraSCCo五折交叉验证测试集上的微平均评估结果。我们在此也列出了GitHub仓库888https://github.com/calgo-lab/redakt-grascco和其他资源999https://grascco.demo.calgo-lab.de/以获取更多信息。
### 3.3 LER - 德语法律文本
为将隐私评估扩展到电子邮件和临床文本之外,我们还在德国法律实体识别(LER)数据集[9](https://arxiv.org/html/2608.18260#bib.bib7), [8](https://arxiv.org/html/2608.18260#bib.bib8)上微调了相同的三个模型架构。尽管LER并非专门的PII语料库,但它包含大量与隐私相关类别重叠的实体,即人员、地点和组织,这些占所有标注实体的25.66%。剩余的74.34%对应于法律领域特定的实体类型,如法律规范、法规、法院判决等。这种混合使我们能够评估模型在密集领域特定术语旁识别经典个人标识符的鲁棒性。我们采用数据集提供的原始训练-开发-测试划分,未引入额外的重采样或交叉验证。表2(https://arxiv.org/html/2608.18260#S3.T2)描述了模型在LER数据集测试样本上检测12种PII标签实体的宏平均性能重计算结果。
## 4 实用性评估
我们通过训练原始文本上的模型并在编辑文本上评估分类性能来研究匿名化文本的实用性,这是对先前工作[12](https://arxiv.org/html/2608.18260#bib.bib10)的扩展,并增加了两个新任务:医疗意图分类和法律违规预测。在这些领域中,我们通过用语义占位符、随机掩码和通用掩码替换PII来比较实用性,以分析不同匿名化策略如何影响任务特定语言信息的丢失、模型鲁棒性和下游实用性。更多实验细节及为促进可复现性,请参考项目GitHub仓库101010https://github.com/calgo-lab/redacted-text-utility。
### 4.1 医疗意图分类
在我们的第一个实验中,我们使用由[13](https://arxiv.org/html/2608.18260#bib.bib11)引入的医疗意图分类(MIC)数据集111111https://huggingface.co/datasets/DATEXIS/med_intent_classification,该研究探讨了医生-患者对话中的医生意图轨迹。该数据集源自环境临床智能基准(ACI-Bench)[17](https://arxiv.org/html/2608.18260#bib.bib12)语料库,包含5,541个医生轮次,标注了20个细粒度意图分类法。每个样本由单个医生话语组成,目标是预测一个或多个相关的医疗意图,使其成为一个多标签分类问题。我们使用一个在OntoNotes[16](https://arxiv.org/html/2608.18260#bib.bib13)(一个英语NER语料库131313https://catalog.ldc.upenn.edu/LDC2013T19)上使用Flair[1](https://arxiv.org/html/2608.18260#bib.bib14), [15](https://arxiv.org/html/2608.18260#bib.bib15)微调的模型121212https://huggingface.co/flair/ner-english-ontonotes-large来识别和编辑私有实体(PERSON, DATE, GPE, ORG),并进行了额外过滤以去除虚假检测。
表3:应用于临床文本的编辑策略示例
图2:匿名化文本上的医疗意图分类
表4:匿名化文本上的二元违规预测
我们为多标签意图分类下游任务微调了三种不同的Transformer模型,并报告了每种编辑(表3 https://arxiv.org/html/2608.18260#S4.T3)条件下的性能指标,图2(https://arxiv.org/html/2608.18260#S4.F2)中误差棒表示五折交叉验证折叠间的性能变异性。
### 4.2 二元违规预测
我们在欧洲人权法院(ECHR)数据集141414https://huggingface.co/datasets/glnmario/ECHR上进行了第二次实用性评估,该数据集由[3](https://arxiv.org/html/2608.18260#bib.bib16)引入。与原作一致,我们将实验限制在二元违规预测(BVP)任务上,即确定《欧洲人权公约》的任何人权条款是否被违反。我们使用了与MIC任务类似的实验设置(相同的编辑模型和策略)。三个基于Transformer的文档分类器使用Flair框架进行微调,支持长序列。表4(https://arxiv.org/html/2608.18260#S4.T4)展示了这些模型在测试集上针对不同编辑策略的宏平均性能,以衡量隐私驱动净化对实用性的影响。我们的结果表明,编辑并未实质性地影响实用性。语义标签掩码的编辑影响最小。我们在附录0.A(https://arxiv.org/html/2608.18260#Pt0.A1)中针对文本中PII实体数量控制进行了更深入的分析。在所研究的大多数实验条件下,编辑对匿名化文本的实用性影响有限。
## 5 结论
我们的Redakto演示器提供了一个Web应用程序、REST API和MCP接口,可在LLM内直接使用。与其他用于LLM使用的编辑工具实现不同,我们将实现与编辑性能和编辑文本实用性的全面评估相结合。实证评估不仅表明Redakto在多种领域中能可靠地匿名化文本,我们的结果还显示匿名化文本的实用性未受相似文章
TextCloak:以RL驱动的不可学习文本阻止未经授权的LLM利用
TextCloak是一个新的RL驱动框架,用于生成不可学习的文本示例,以保护数据免遭未经授权的LLM微调,在保持语义保真度的同时,降低模型在多个数据集和LLM上的效用。
LLM匿名化对抗代理性重新识别
AURA是一个基于LLM的匿名化框架,通过自适应隐私范围和mask-reconstruct方法在保护隐私以抵抗代理性网络搜索重新识别的同时,保持上下文效用,从而平衡隐私保护与效用保持。
LearningCircuit/local-deep-research
一款注重隐私的本地深度研究工具,支持多种大语言模型(LLM)和搜索引擎,在保持数据加密和本地化的同时,在问答任务上实现高精度。
PrivacyAkinator: 通过回答LLM生成的多选题阐述关键隐私设计决策
本文介绍了PrivacyAkinator,一个交互式工具,帮助新手开发者通过LLM生成的多选题来阐述隐私设计决策,与NIST的PRAM方法相比,在减少73%的时间的同时,识别出多47%的关键决策。
移除还是保留?用于教育对话去标识化的全本地AI级联
本文提出了一种用于教育对话去标识化的全本地AI级联框架,结合了先召回候选生成器与上下文感知的移除/保留评审器。该方法在不将数据发送到外部API的情况下实现了高精度,在数学辅导记录上优于更小的本地模型和商业API。