无人知晓:用于文本匿名化的风格感知改写

arXiv cs.CL 论文

摘要

本文提出了一种风格感知的、基于提示驱动的文本匿名化方法,利用大型语言模型在保留语义的同时抑制可识别的风格标记,将作者归属F1值降低60–70%,并优于基于差分隐私的方法。

arXiv:2609.12341v1 公告类型:新 摘要:作者归属模型能够通过利用稳定的风格指纹,从看似匿名的文本中重新识别用户,即使在明确标识符被移除后,这对文本发布和分析构成了日益严重的隐私风险。这种风险延伸到由语音派生的文本,如会议和呼叫中心对话的ASR转录本,其中风格计量泄露在声学匿名化后可能仍然存在。基于差分隐私的匿名化通常会严重降低文本质量和实用性。我们提出了一种风格感知的、基于提示的匿名化方法,该方法使用预训练的大型语言模型从最小样本中构建紧凑的风格特征,并重写文本以抑制可识别的风格标记,同时保留意义。在博客和评论数据集上,我们的方法将作者归属F1值降低了60-70%,同时保持了内容质量和可读性,显著优于基于差分隐私和非差分隐私的基线方法。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:32

# 我是谁:面向文本匿名化的风格感知改写
来源:https://arxiv.org/html/2609.12341
Khan He Wachowicz Naghizade

###### 摘要

作者归属模型能够通过利用稳定的风格指纹,从看似匿名的文本中重新识别用户,即使在显式标识符被移除后也是如此,这对文本发布和分析构成了日益增长的隐私风险。这种风险也延伸到由语音派生的文本,例如会议的ASR转录稿和呼叫中心对话,其中文体计量特征泄露即使在声学匿名化之后也可能持续存在。基于差分隐私的匿名化方法通常会严重降低文本质量和实用性。我们提出了一种风格感知、提示驱动的匿名化方法,该方法使用预训练的大语言模型从极少量样本中构建紧凑的风格特征描述,并重写文本以在保持语义的同时抑制可识别的风格标记。在博客和评论数据集上,我们的方法将作者归属F1分数降低了60-70%,同时保持了内容质量和可读性,显著优于基于差分隐私和无差分隐私的基线方法。

###### 关键词

文本匿名化、作者归属、文体计量学、语言处理、隐私保护NLP

††地址:澳大利亚墨尔本皇家墨尔本理工大学††邮箱:ahmed\.sohair\.khan@rmit\.edu\.au, estrid\.he@rmit\.edu\.au, monica\.wachowicz@rmit\.edu\.au, e\.naghizade@rmit\.edu\.au††脚注:代码与补充材料:https://github.com/ahmedsohair/SAPTA26## 1引言与相关工作

在线内容的广泛分享引发了用户隐私方面的重大担忧。嵌入用户生成的文本或ASR转录稿中的微妙风格模式,即使用户试图保持匿名,也可被用来识别和追踪原始作者。这种被称为“作者归属”的实践对个人隐私构成威胁,因为它可以暴露用户身份。

传统的匿名化技术,例如移除显式个人标识符,对于能够提取细微风格线索的现代机器学习模型来说是不够的\[1 (https://arxiv.org/html/2609.12341#bib.bib5)\]。因此,文本匿名化还必须模糊那些能够实现作者归属的微妙风格指纹,例如句法、词汇和语篇模式\[2 (https://arxiv.org/html/2609.12341#bib.bib6)\]。

相关的语音隐私研究大多针对声学说话人特征,但文体计量特征泄露在语音派生文本中仍然可能存在。先前的研究表明,去标识化可能会影响基于转录的抑郁症检测\[3 (https://arxiv.org/html/2609.12341#bib.bib24)\],而近期的工作通过对转录稿进行改写来匿名化*语音内容风格*,以在保持语义的同时减少识别性\[4 (https://arxiv.org/html/2609.12341#bib.bib25)\]。

最近,基于差分隐私的方法,如DP-VAE\[5 (https://arxiv.org/html/2609.12341#bib.bib7)\]、DP-Prompt\[6 (https://arxiv.org/html/2609.12341#bib.bib2)\]和DP-MLM\[7 (https://arxiv.org/html/2609.12341#bib.bib8)\],因其在隐私预算下引入校准噪声而在文本匿名化领域受到关注。然而,DP的数学保证伴随着一个关键的权衡:隐私预算ε的选择会极大地影响实用性。高ε设置导致隐私性差,而低ε设置则会将文本降级到难以阅读。图1 (https://arxiv.org/html/2609.12341#S1.F1)表明,即使有正式的隐私保证,基于DP的方法仍可能保留可识别的风格模式。这是因为潜在层面的DP机制未能破坏高阶句法结构,而令牌层面的噪声注入则降低了实用性,却未能完全消除作者线索。

近期研究质疑严格的DP对于防御作者归属是否必要\[8 (https://arxiv.org/html/2609.12341#bib.bib9)\]。非DP改写方法已经出现,包括JAMDEC\[9 (https://arxiv.org/html/2609.12341#bib.bib19)\](使用约束波束解码)和STYLEREMIX\[10 (https://arxiv.org/html/2609.12341#bib.bib1)\](应用细粒度的风格转换)。其他系统,如ALISON\[11 (https://arxiv.org/html/2609.12341#bib.bib23)\],通过排序风格显著短语并进行替换,明确针对风格特征,表明直接针对文体计量特征可以带来强大的隐私增益。早期的方法,如ER-AE\[12 (https://arxiv.org/html/2609.12341#bib.bib4)\]和DP-Paraphrase\[13 (https://arxiv.org/html/2609.12341#bib.bib14)\],也旨在平衡隐私和实用性。然而,大多数方法仍然依赖于随机扰动或通用改写,而没有对风格标记进行显式控制。

我们认为,有效的匿名化应该专注于中和作者特定的风格属性,而不是不加选择地注入噪声。这引出了我们的核心研究问题:如何利用风格转换在匿名化用户生成文本的同时保持内容实用性,而无需诉诸噪声注入?

我们提出了一种风格感知、提示驱动的匿名化方法,该方法使用大语言模型通过捕获文本长度、标点符号模式、词汇选择和语气来构建显式的风格特征描述。然后,它在保持内容的前提下重写文本以模糊这些标记。与依赖噪声注入或通用改写的方法不同,我们的方法提供了细粒度的控制,以平衡匿名化和语义内容保留。在跨越短文本和长文本的两个真实世界数据集上的实验表明,通过避免显式噪声注入,以风格为重点的重写可以有效降低作者归属准确性,同时保持接近原始的语义并提高可读性。

参见图注:图1:原始文本(*左*)和DP匿名化版本(*右*)。DP版本中残留的风格线索可能支持重新识别。
## 2方法论

给定作者集合A=\{A1,...,AN\}\mathcal\{A\}=\\\{A\_\{1\},\\dots,A\_\{N\}\\\}及其语料库Di\mathcal\{D\}\_\{i\},我们通过将每个输入文本x∈Dix\\in\\mathcal\{D\}\_\{i\}重写为匿名化输出x^\hat\{x\},生成匿名化版本D^i\hat\{\\mathcal\{D\}\}\_\{i\}。我们的目标是让作者归属分类器F⁡\(⋅\)\mathcal\{F\}\(\\cdot\)无法可靠地恢复真实作者。形式上,我们旨在确保F⁡\(x^\)\mathcal\{F\}\(\\hat\{x\}\)\\neq i(或对作者i赋予低概率),同时保持语义内容和流畅性。我们并非注入随机噪声,而是将匿名化重新定义为一个受控风格转换问题。我们的框架(图2 (https://arxiv.org/html/2609.12341#S2.F2))由两个紧密耦合的模块组成:一个风格分析模块(Style\-Profiling Module),用于从极少量样本中提取每位作者的风格指纹;一个风格引导改写模块(Style\-Guided Rewriting Module),利用该特征描述作为控制信号来中和这些线索。

### 2.1风格分析模块

作者归属的成功在于提取独特的风格模式。根据经典的文体计量学,我们沿着四个关键维度来描述这些指纹:句子长度、词汇选择、语气和标点符号模式\[14 (https://arxiv.org/html/2609.12341#bib.bib20),15 (https://arxiv.org/html/2609.12341#bib.bib21),16 (https://arxiv.org/html/2609.12341#bib.bib22)\]。我们不是学习隐式的风格表示,而是旨在提取这些维度的、人类可解释的风格描述。

给定作者AiA\_\{i\}的训练文本Ditrain\mathcal\{D\}\_\{i\}^\{\\text\{train\}\},我们采样KK篇代表性文本,形成风格证据集Si=\{x1,...,xK\}\mathcal\{S\}\_\{i\}=\\\{x\_\{1\},\\dots,x\_\{K\}\\\}。我们提示LLM总结作者在四个关键文体计量维度上的写作风格,并将这些提取为人类可读的特征描述si s\_\{i\}。此模块有两个关键控制点:(i)特征描述大小K K,指定用于风格分析的作者样本数量。我们通过实验发现K=5K=5在两个数据集上都能提供稳定且作者区分度高的特征描述;(ii)风格通道,控制特征描述中包含哪些风格维度,即全部(捕获所有维度的完整特征描述)或单个维度(例如,仅长度、仅语气)。这使我们能够识别对匿名化最关键的风格标记。

### 2.2风格引导改写模块

给定源文本x x及其特征描述si s\_\{i\},匿名化输出x^\hat\{x\}是通过提示LLM在抑制已识别风格线索的同时进行改写而生成的。提示指令要求保留语义内容。与均匀重写的通用改写基线不同,我们的方法提供了细粒度的控制:风格特征描述指定了要中和哪些维度,从而实现有针对性的匿名化。此模块是攻击者无关的——我们假设无法访问对手的分类器,并且不针对任何特定攻击者进行优化。

此模块有一个关键控制点:改写模式,决定风格特征描述如何引导重写。风格引导式(Style\-guided)将显式的特征描述提供给LLM(我们的主要方法),从而实现对哪些风格标记被抑制的精确控制。半引导式(Semi\-guided)指示LLM以中性风格重写,但不提供显式特征描述。这旨在测试显式特征描述是否能同时改善隐私和实用性。无引导式(Unguided)执行通用改写,不提及风格,作为下限基线。

参见图注:图2:(1) 风格分析模块从KK个样本生成每位作者的特征描述si s\_\{i\};(2) 风格引导改写模块使用特征描述引导将文本x x重写为匿名化文本x^\hat\{x\}。

## 3实验设置

### 3.1数据集与基线

遵循\[8 (https://arxiv.org/html/2609.12341#bib.bib9)\],我们使用Author10,这是Blog Authorship Corpus\[17 (https://arxiv.org/html/2609.12341#bib.bib10)\]的子集,包含来自10位作者的15,070篇长篇博客。对于短文本评估,我们构建了Illinois9,这是Google Reviews\[18 (https://arxiv.org/html/2609.12341#bib.bib3)\]的子集,包含来自伊利诺伊州最频繁的9位评论者的3,959条评论。表1 (https://arxiv.org/html/2609.12341#S3.T1)从作者数量、每位作者的文档数(D/A)、每句话的单词数(W/S)和每个文档的句子数(S/D)方面总结了两个数据集。

表 1:Author10和Illinois9的数据集统计信息

我们与来自\[8 (https://arxiv.org/html/2609.12341#bib.bib9)\]的三种DP变体进行比较:(i) DP,严格的DP-Prompt,隐私预算ε∈\{25,100,250\}\epsilon\\in\\\{25,100,250\\\};(ii) 准DP(Quasi\-DP),省略了logit裁剪但保留了基于温度的采样;(iii) 非DP(Non\-DP),无DP约束的改写。此外,我们还包含了ALISON\[11 (https://arxiv.org/html/2609.12341#bib.bib23)\],这是一个基于文体计量学的非DP基线。

### 3.2评估指标

效用指标。我们使用三个互补的指标评估效用:(1) 余弦相似度(CS):如\[8 (https://arxiv.org/html/2609.12341#bib.bib9)\]所述,我们使用三个预训练模型all\-minilm\-l6\-v2、all\-mpnet\-base\-v2和gte\-small\[19 (https://arxiv.org/html/2609.12341#bib.bib12)\]对每段文本进行嵌入,并报告跨模型的平均*余弦相似度(CS)*;(2) 困惑度(PPL)\[5 (https://arxiv.org/html/2609.12341#bib.bib7)\],使用GPT-2\[20 (https://arxiv.org/html/2609.12341#bib.bib13)\]测量,以评估流畅性;(3) 加权KL散度,它通过给稀有且信息量大的词赋予更高重要性来量化信息损失:

DW\-KL\(P∥Q\)=∑t∈VIDF\(t\)P\(t\)logP⁡\(t\)Q⁡\(t\),D\_\{\\mathrm\{W\\text\{\-\}KL\}\}\(P\\parallel Q\)=\\sum\_\{t\\in V\}\\mathrm\{IDF\}\(t\)\\,P(t)\\,\\log\\frac\{P(t)\}\{Q(t)\},\(1\)

其中PP和QQ是词频分布,IDF⁡\(t\)\\mathrm\{IDF\}\(t)对稀有词进行加权。虽然在丢弃稀有词(例如,命名实体、领域特定术语)时余弦相似度可能仍然很高,但加权KL散度会对这种损失进行惩罚。这对于确保匿名化文本保留信息内容,而不仅仅是表面语义相似性至关重要。[更多详情请参见补充材料。]

隐私指标。我们使用四个互补的指标评估隐私性:(1) BLEU\[21 (https://arxiv.org/html/2609.12341#bib.bib11)\],衡量原始文本和匿名化文本之间的词汇差异;(2) 作者归属F1,量化匿名化文本在多大程度上隐藏了原始作者身份。较低的F1表示更强的隐私性。按照标准对抗设置,作者分类器在原始数据上训练,在匿名化数据上评估,Author10使用DeBERTa-v3\[22 (https://arxiv.org/html/2609.12341#bib.bib17)\],Illinois9使用BERT\[23 (https://arxiv.org/html/2609.12341#bib.bib18)\](已证明对短文本有效);(3) 相对增益(γ)\[13 (https://arxiv.org/html/2609.12341#bib.bib14),8 (https://arxiv.org/html/2609.12341#bib.bib9)\],突出隐私-效用权衡:

γ=SpSo−ApAo,\\gamma=\\frac\{S\_\{p\}\}\{S\_\{o\}\}\-\\frac\{A\_\{p\}\}\{A\_\{o\}\},\(2\)

其中AA和SS分别表示原始数据(下标o)和匿名化数据(下标p)上的作者归属F1和余弦相似度。更高的γ表示更好的隐私-效用权衡。(4) 流畅性感知增益,它通过惩罚困惑度下降来扩展γ:

γf=12\(SpSo\+min⁡\(PoPp,1\)\)−ApAo,\\gamma\_\{f\}=\\frac\{1\}\{2\}\\left\(\\frac\{S\_\{p\}\}\{S\_\{o\}\}\+\\min\\left\(\\frac\{P\_\{o\}\}\{P\_\{p\}\},1\\right\)\\right\)\-\\frac\{A\_\{p\}\}\{A\_\{o\}\},\(3\)

其中PP表示困惑度。此指标防止方法通过严重降低可读性来改善隐私性。

### 3.3参数设置

我们使用Llama-3.2-3B-Instruct\[24 (https://arxiv.org/html/2609.12341#bib.bib16)\]作为分析和改写的基础LLM,选择它是因为其指令遵循能力和开源可用性。我们还评估了MiniCPM3-4B\[25 (https://arxiv.org/html/2609.12341#bib.bib15)\]以测试模型无关性。对于风格分析,我们使用每位作者K=5K=5个样本,我们通过实验发现这已足够(关于K∈\{2,5,10,20\}K\\in\\\{2,5,10,20\\\}的分析请参见补充材料)。

## 4结果与讨论

表 2:在Author10和Illinois9上与基线匿名化方法的比较

| 原始文本 | DP (ε) | 准DP (ε) | 非DP (k) | ALISON | 我们的方法 | ε/k |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| | **25** | **100** | **250** | **25** | **100** | **250** | **50** | **10** | **3** | – | LLama | MiniCPM |
| **Author10** | | | | | | | | | | | | |
| CS↑ | **10.589** | 0.812 | 0.832 | 0.347 | 0.810 | 0.833 | 0.710 | 0.750 | 0.787 | 0.704 | 0.702 | 0.820 |
| BLEU↓ | **10.077** | 0.123 | 0.153 | 0.001 | 0.121 | 0.153 | 0.049 | 0.063 | 0.088 | 0.094 | 0.023 | 0.213 |
| PPL↓ | **418770** | 928 | 905 | 16926 | 982 | 925 | 816 | 1080 | 837 | 368.30 | 42.47 | 61.53 |
| Author F1↓ | **66.45** | 7.13 | 58.10 | 60.60 | 6.59 | 57.84 | 61.13 | 46.83 | 49.88 | 53.10 | **29.53** | 26.02 |
| 相对增益 (γ) | – | 0.482 | -0.062 | -0.080 | **0.248** | -0.060 | -0.087 | 0.005 | -0.001 | -0.012 | 0.260 | **0.310** |
| 流畅性感知增益 (γflu) | – | -0.190 | -0.446 | -0.473 | 0.076 | -0.445 | -0.481 | -0.325 | -0.357 | -0.381 | -0.037 | **0.442** |
| **Illinois9** | | | | | | | | | | | | |
| CS↑ | **10.592** | 0.894 | 0.914 | 0.595 | 0.892 | 0.916 | 0.812 | 0.840 | 0.879 | 0.606 | 0.709 | 0.890 |
| BLEU↓ | **10.013** | 0.432 | 0.497 | 0.015 | 0.424 | 0.520 | 0.255 | 0.292 | 0.373 | 0.094 | **0.022** | 0.310 |
| PPL↓ | **98.83** | 220.66 | 89.15 | 96.99 | 222.16 | 89.63 | 94.93 | 82.19 | 75.89 | 84.72 | **461.37** | 53.36 |
| Author F1↓ | **76.78** | 23.42 | 61.73 | 64.86 | 21.84 | 59.90 | 65.35 | 49.32 | 51.22 | 54.94 | **20.76** | 29.72 |
| 相对增益 (γ) | – | 0.287 | 0.090 | 0.069 | **0.311** | 0.112 | 0.065 | 0.170 | 0.173 | 0.163 | 0.220 | **0.439** |
| 流畅性感知增益 (γf) | – | -0.215 | 0.143 | 0.112 | 0.235 | 0.166 | 0.107 | 0.264 | 0.253 | 0.224 | 0.023 | **0.584** |

- •*注意:*最佳结果以**粗体**显示;次佳结果以*斜体*显示。(注意:原文至此截断,此为基于上下文推测的完整翻译)

相似文章

小而足:通过LoRA适配器对AI编辑文本进行逐用户风格重写

arXiv cs.CL

本文介绍了InMyStyle,一个隐私优先的系统,它在小型语言模型(0.5B–7B)上使用LoRA适配器,无需显式提示即可将AI编辑过的文本重写为符合个人用户写作风格的文本。评估显示,不同模型规模下质量趋于平稳,表明紧凑型模型足以胜任此任务。

网络匿名已悄然消亡,却无人提及

Reddit r/singularity

本文表明,大型语言模型可以通过跨平台匹配非结构化文本,对化名在线账户执行完全自动化的大规模去匿名化,在90%精确率下实现高达68%的召回率,使先前的实际匿名性变得过时。

论匿名化对大型语言模型性能的影响

arXiv cs.CL

本文系统性地实证研究了在大型语言模型中匿名化输入数据时隐私与性能的权衡,发现匿名化会降低性能,且影响因模型能力和任务类型而异。

大语言模型威胁双盲评审

arXiv cs.CL

本文证明,仅凭标题和摘要,大语言模型就能有效解除科学论文作者匿名,从而威胁到双盲同行评审的有效性。作者认为,问题框架和研究焦点中的稳定模式构成了作者身份的潜在概念特征,这要求我们在人工智能增强的研究生态系统中重新评估匿名实践。