TextCloak:以RL驱动的不可学习文本阻止未经授权的LLM利用
摘要
TextCloak是一个新的RL驱动框架,用于生成不可学习的文本示例,以保护数据免遭未经授权的LLM微调,在保持语义保真度的同时,降低模型在多个数据集和LLM上的效用。
arXiv:2607.28862v1 公告类型:新
摘要:大型语言模型(LLMs)的快速发展在广泛的语言任务中带来了显著进步,同时也引发了对未经授权的数据利用和隐私泄露的日益关注。不可学习示例(UEs)通过向数据中引入精心设计的扰动,使得在这些数据上训练的模型表现出效用下降,从而提供了一种有前景的防御手段。然而,现有的文本保护方法主要针对判别式语言模型中的分类任务(如情感分析)设计,且通常依赖于注入类别特定的语言线索,这限制了它们在LLM开放式生成场景中的有效性。在这项工作中,我们提出了TextCloak,一个RL驱动的框架,用于保护文本数据免受未经授权的LLM利用。TextCloak采用生成策略,将批量干净文本转换为不可学习示例,同时保持语义保真度和语言自然性。为了优化该策略,我们引入了GRPO-UE,它根据生成的不可学习文本在微调后的代理LLM中引起的下游性能下降来给予奖励,并通过群组相对策略优化更新生成器参数。这种双层优化使生成器能够发现超越类别特定线索的泛化保护模式。在六个公开数据集和九个最先进的LLM上进行的全面实验表明,TextCloak在保持文本对合法用途的效用的同时,持续削弱未经授权的微调。进一步的分析证实了其在模型架构、训练配置和自适应攻击下的可迁移性和鲁棒性,突显了其作为抵御未经授权LLM利用的实际防御手段的广泛适用性。
查看缓存全文
缓存时间: 2026/08/03 07:34
# TextCloak:通过基于强化学习的不可学习示例抵御未经授权的LLM利用
来源:https://arxiv.org/html/2607.28862
Pingchuan Ma, Dawei Li, Bohan Jiang, Zhiyuan Yu, Zhen Tan, Huan Liu
###### 摘要
大型语言模型(LLMs)的快速发展推动了各类语言任务的显著进步,同时也引发了人们对未经授权数据利用和隐私泄漏的日益担忧。不可学习示例(UEs)通过向数据中引入精心设计的扰动,使得基于这些数据训练的模型效用严重下降,从而提供了一种有前景的防御手段。然而,现有的文本保护方法主要针对判别式语言模型中的分类任务(如情感分析)设计,且通常依赖注入类别特定的语言线索,这限制了它们在LLM开放式生成场景中的有效性。在本工作中,我们提出了TextCloak——一个基于强化学习(RL)的框架,用于保护文本数据免受未经授权的LLM利用。TextCloak采用生成式策略将成批的干净文本转换为不可学习示例,同时保持语义保真度和语言自然度。为了优化该策略,我们引入了GRPO-UE,该方法基于生成文本在微调后的替代LLM上所导致的下游性能下降来给予奖励,并通过组相对策略优化更新生成器参数。这种双层优化使生成器能够发现超越类别特定线索的泛化性保护模式。我们在六个公开数据集和九个最先进的LLM上进行了全面实验,验证了TextCloak的有效性、可迁移性、鲁棒性和广泛适用性。
## 1 引言
参见图注 图1:面向LLM的UEs示意图。
大型语言模型(LLMs)的快速普及已经彻底改变了自然语言处理,在开放式文本生成、复杂推理和指令跟随等任务中带来了前所未有的性能表现(Brown等,2020(https://arxiv.org/html/2607.28862#bib.bib1);Ouyang等,2022(https://arxiv.org/html/2607.28862#bib.bib4);Li等,2025(https://arxiv.org/html/2607.28862#bib.bib5);Zhao等,2026b(https://arxiv.org/html/2607.28862#bib.bib49))。这些进展主要由在海量网络爬取文本数据上的预训练和微调所推动,但也引发了关于未经授权数据利用和隐私侵犯的严重关切(Carlini等,2021(https://arxiv.org/html/2607.28862#bib.bib9);Zhao等,2026a(https://arxiv.org/html/2607.28862#bib.bib6))。不道德的实体经常在未经同意的情况下抓取专有、敏感或用户拥有的文本,用于微调商业LLM,从而可能导致个人信息泄漏或侵犯知识产权(Kandpal等,2022(https://arxiv.org/html/2607.28862#bib.bib10))。因此,赋予数据创作者主动防御机制以保护其文本资产免受未经授权的LLM微调,已成为一项紧迫的需求。
为了应对未经授权的数据利用,不可学习示例(UEs)已成为一种有前景的防御策略(Huang等,2021(https://arxiv.org/html/2607.28862#bib.bib11))。通过在数据发布前注入精心设计的小扰动,UEs会诱导捷径学习效应,使得在这些数据集上训练的模型遭受严重的效用下降,而底层文本对于合法的人类读者来说仍然在功能上保持完整。虽然UEs已在计算机视觉领域得到广泛探索(Li等,2026(https://arxiv.org/html/2607.28862#bib.bib48)),但将不可学习示例扩展到LLM场景面临独特的挑战。现有的文本UEs方法主要针对预训练语言模型中的封闭集分类任务(如情感分析或主题分类)设计,并且严重依赖注入静态的类别特定语言线索或表面级触发器(Li等,2023(https://arxiv.org/html/2607.28862#bib.bib14);Wallace等,2019(https://arxiv.org/html/2607.28862#bib.bib15))。然而,现代LLM微调主要关注指令跟随和推理任务,其中不存在显式类别标签。因此,现有的面向分类的文本保护技术无法泛化,使得文本数据容易受到未经授权的LLM利用。此外,文本数据具有丰富的语义和连贯性。通过字符替换或触发器插入进行的离散文本编辑可能会改变含义或产生明显的伪影,这可能损害文本对合法用户的效用。因此,实用的防御方法必须保持语义保真度和语言自然度。
为了弥合这一差距,我们提出了TextCloak——一个基于RL的框架,旨在保护文本数据免受未经授权的LLM微调。与现有的启发式方法不同,TextCloak将不可学习文本生成形式化为一个带约束的双层优化问题。具体来说,我们设计了一个生成式策略,将成批的干净文本转换为不可学习的变体。该策略直接在自然语言空间中操作,从而能够保持语言质量。为了优化这一生成式策略,我们进一步引入了GRPO-UE,它显式地考虑模型微调过程,并动态衡量生成的不可学习文本所导致的下游性能下降。GRPO-UE利用这种下降作为奖励信号,通过组相对策略优化更新生成器参数,使其能够发现有效的不可学习模式,从而削弱LLM的泛化能力。
我们的主要贡献总结如下:
- **问题形式化。** 我们识别了LLM时代保护文本数据的需求,并将其形式化为一个带约束的双层优化问题。
- **新颖框架。** 我们提出了TextCloak——一个基于RL的框架,在保持语义保真度和语言自然度以供合法使用的同时,制造不可学习文本。据我们所知,TextCloak是第一个利用不可学习示例来防御未经授权的LLM微调的框架。
- **优化机制。** 我们提出了GRPO-UE,它通过下游性能下降动态衡量保护效果,并直接引导生成式策略发现有效的不可学习模式。
- **全面评估。** 我们在六个公开数据集和九个最先进的LLM上进行了广泛评估,验证了TextCloak的有效性、可迁移性、鲁棒性和广泛适用性。
## 2 相关工作
### 2.1 不可学习示例
不可学习示例(Huang等,2021(https://arxiv.org/html/2607.28862#bib.bib11))通过向训练数据中注入小扰动,使得在受保护样本上训练的模型表现出效用下降,最初是在计算机视觉领域提出的。后续研究提高了UEs的鲁棒性和实用性。例如,研究者开发了鲁棒的误差最小化扰动以抵抗对抗训练(Fu等,2022(https://arxiv.org/html/2607.28862#bib.bib39)),而可迁移的UEs旨在跨模型架构、优化过程和数据集保持其保护效果(Ren等,2023(https://arxiv.org/html/2607.28862#bib.bib40))。其他扩展放宽了防御者和未经授权的训练者使用相同类别标签的要求(Zhang等,2023(https://arxiv.org/html/2607.28862#bib.bib41))。
最近,一些工作尝试将UEs扩展到文本数据。例如,Li等人(2023(https://arxiv.org/html/2607.28862#bib.bib14))通过梯度引导的token搜索制造不可学习文本,随后从优化后的示例中提取可复用的表面模式。RegText(Java等,2024(https://arxiv.org/html/2607.28862#bib.bib42))类似地通过任务代表性低频词引入虚假相关性,以降低预训练语言模型的泛化能力。在这些开创性工作的启发下,TextCloak首次在LLM背景下探索不可学习示例,聚焦于自然语言理解和推理任务。
### 2.2 LLM中的数据投毒
数据投毒攻击通过操纵模型的训练语料来改变其学习到的行为(Steinhardt等,2017(https://arxiv.org/html/2607.28862#bib.bib50))。早期的投毒研究通常关注分类模型,攻击者修改标签或插入触发器特征以诱导目标预测错误(Fan等,2022(https://arxiv.org/html/2607.28862#bib.bib51))。随着网络规模预训练和指令微调的日益普及,这种威胁已扩展到LLM。对指令微调数据进行投毒可以将特定概念或短语与攻击者选择的行为关联起来,并且这些行为会迁移到多个下游任务(Wan等,2023(https://arxiv.org/html/2607.28862#bib.bib16))。指令本身也可以作为后门触发器,使攻击者无需直接修改单个输入实例或其标签即可操纵模型(Xu等,2024(https://arxiv.org/html/2607.28862#bib.bib17))。软提示注入进一步表明,少量被投毒的指令-响应对可以植入持久的、上下文依赖的行为,同时在大体上保持对良性输入的性能(Yan等,2024(https://arxiv.org/html/2607.28862#bib.bib18))。总的来说,这些发现说明了LLM微调对精心构造的训练示例的敏感性。TextCloak并未利用这种敏感性进行恶意目的,而是赋权数据所有者在数据发布前主动保护文本。
### 2.3 针对未经授权LLM利用的防御
现有的针对未经授权LLM利用的防御措施包括使用控制、事后归属、模型侧修复和主动数据保护。访问限制、许可证和爬虫排除策略表达了内容所有者的偏好,但依赖于自愿合规(Jayaraman等,2026(https://arxiv.org/html/2607.28862#bib.bib53))。水印(Liu等,2024a(https://arxiv.org/html/2607.28862#bib.bib43);Zhang等,2024(https://arxiv.org/html/2607.28862#bib.bib44);Lau等,2024(https://arxiv.org/html/2607.28862#bib.bib45))则向受保护内容中嵌入可识别的信号,使所有者能够测试其数据是否影响了可能未经授权的模型。机器遗忘旨在从已训练的LLM中移除敏感或受版权保护数据的影响(Cao和Yang,2015(https://arxiv.org/html/2607.28862#bib.bib8);Yao和Xu,2024(https://arxiv.org/html/2607.28862#bib.bib46)),但这需要开发者的配合和模型访问权限,并且可能会降低保留知识的质量。主动保护则在数据发布之前进行干预,使内容所有者能够直接控制其文本的可学习性。最近的工作(Liu等,2024b(https://arxiv.org/html/2607.28862#bib.bib47))引入了最小可感知扰动以减少记忆化和实例级成员推断攻击。TextCloak通过开发一种以数据为中心的解决方案来阻止未经授权的LLM利用,与这一研究方向形成互补。
参见图注 图2:所提出的TextCloak框架概述。
## 3 预备知识
### 3.1 问题形式化
令 \(\mathcal{D}=\{(x_i,y_i)\}_{i=1}^N\) 表示一个干净文本语料库,其中 \(x_i\) 是输入或指令,\(y_i\) 是其目标响应序列。数据所有者在发布语料库之前应用保护机制以获得 \(\widetilde{\mathcal{D}}=\{(\widetilde{x}_i,y_i)\}_{i=1}^N\)。受保护的样本对应与原始样本对传达相同的信息,并且保持流畅自然,从而使发布的文本对合法读者保持其效用。
我们考虑一个未经授权的训练者,他收集 \(\widetilde{\mathcal{D}}\) 并通过最小化标准自回归训练损失来针对特定任务微调LLM \(f_\theta\):
\[
\theta^{\star} = \arg\min_\theta \mathcal{L}_{\mathrm{ft}}(f_\theta;\widetilde{\mathcal{D}}).
\tag{1}
\]
数据所有者寻求能够降低训练模型泛化能力的保护。令 \(\mathcal{D}_{\mathrm{eval}}\) 为留出评估数据,\(\mathcal{L}_{\mathrm{eval}}\) 衡量下游误差,值越大表示效用越差。保护目标为:
\[
\widetilde{\mathcal{D}}^{\star} = \arg\max_{\widetilde{\mathcal{D}}\in\mathcal{C}(\mathcal{D})} \mathcal{L}_{\mathrm{eval}}\bigl(f_{\theta^{\star}};\mathcal{D}_{\mathrm{eval}}\bigr),
\tag{2}
\]
其中 \(\mathcal{C}(\mathcal{D})\) 是满足约束(如语义保真度和语言自然度)的可行语料库集合。该形式化刻画了核心权衡:受保护文本应当损害在其上训练的模型,同时不显式改变呈现给合法用户的内容。
### 3.2 用于文本分类的不可学习示例
分类文本UEs(Li等,2023(https://arxiv.org/html/2607.28862#bib.bib14))修改离散token序列,注入任务特定的捷径(如与类别标签相关的词汇模式),以降低在其上训练的模型的泛化能力。形式上,令 \(x_i=(w_{i,1},\ldots,w_{i,T_i})\) 为一个token序列,\(y_i\) 为其类别标签。文本修改 \(\eta_i=(p_i,s_i)\) 将位置 \(p_i\) 处的token替换为词汇表中的候选token \(s_i\),并生成修改后的序列 \(x_i\oplus\eta_i\)。可行修改 \(\mathcal{A}(x_i)\) 通常受编辑预算约束。文本UEs可以通过求解以下双层min-min优化问题来构造:
\[
\min_\theta \frac{1}{N}\sum_{i=1}^N \min_{\eta_i\in\mathcal{A}(x_i)} \ell\bigl(f_\theta(x_i\oplus\eta_i), y_i\bigr).
\tag{3}
\]
模型参数和文本修改被交替优化。由于token替换不可微,使用来自替代模型的一阶梯度来引导有效修改的搜索:
\[
s_i^{\star} = \arg\min_{s\in\mathcal{V}} \bigl(e(s)-e(w_{i,p_i})\bigr)^\top \nabla_{e(w_{i,p_i})} \ell\bigl(f_\theta(x_i), y_i\bigr),
\tag{4}
\]
其中 \(\mathcal{V}\) 是词汇表,\(e(\cdot)\) 表示预训练语言模型中的token嵌入。
## 4 提出的TextCloak框架
### 4.1 概述
我们提出了TextCloak——一个基于RL的框架,用于保护文本免受未经授权的LLM利用,它包含三个关键组件。首先,TextCloak利用生成式策略将干净语料库重写为保持语义的不可学习文本。其次,GRPO-UE通过微调替代LLM并评估在留出干净数据上所产生的性能下降来衡量修改后的候选样本。同一批次生成的候选样本形成一个比较组,使得它们的下降分数可以转换为相对优势,而无需学习价值模型。第三,一个带约束的双层循环在内部替代LLM微调和外部策略更新之间交替,以更新生成式策略参数。整体框架(完整图示请参见图2)。相似文章
隐藏、重建与越狱:利用多模态大语言模型中的重建-隐藏权衡
本文分析了针对多模态大语言模型(MLLMs)的意图混淆越狱攻击中存在的重建-隐藏权衡问题。提出了感知隐藏的变体构建方法和与关键词相关的干扰图像,以更有效地利用模型漏洞。
使用“经典”机器学习检测LLM生成的文本
一位开发者探索使用经典机器学习来检测LLM生成的网络小说,创建了一个开源演示和模型,单句准确率约为85%。
LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘
本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。
不要让LLM说话,直接探测它(8分钟阅读)
本文介绍了一种技术,该技术从LLM的最后一个提示标记处提取隐藏状态,无需文本生成即可进行分类,使用一个小型MLP读取模型的内部决策,从而实现快速且廉价的零样本分类器。
PreUnlearn:在大语言模型遗忘前审计附带知识损害
本文提出了PreUnlearn,一个在LLM遗忘执行前审计附带知识损害的框架,采用以数据为中心的分析来预测跨语义层的下游损害。