GRASP:通过组相对策略优化强化语言模型匿名化器
摘要
介绍GRASP,一种使用组相对策略优化来训练小型设备端语言模型进行对抗性匿名化的方法,在运行成本仅为前沿教师模型的一小部分的同时,改善了相对于DPO蒸馏基线的隐私-效用权衡。
arXiv:2608.06526v1 公告类型:新增
摘要:大型语言模型可以从普通文本中推断出敏感的个人属性,如年龄、地点和职业,将日常写作变成隐私风险。对抗性匿名化通过使用同时扮演攻击者的强大语言模型重写文本来防御这一点,但它在推理时需要强大的模型,从而将私人文本发送给第三方——这正是匿名化本应防止的暴露。最近的工作通过监督微调和直接偏好优化(DPO)将这种行为蒸馏到小型设备端模型中,但DPO只是模仿教师的离线选择,从未直接优化我们所关心的隐私-效用目标。我们提出\textbf{GRASP}(\textbf{G}roup-\textbf{R}elative \textbf{A}onymization via \textbf{S}elf-refinement \textbf{P}olicy-optimization),它通过组相对策略优化在线强化本地匿名化器。一个单一的小模型同时充当匿名化器、攻击者和效用评判者,根据自我生成的奖励进行训练,在隐藏属性的同时保留意义,并设计了防止奖励黑客攻击的机制。在Llama-3.1-8B上训练的\ours{}改善了相对于DPO蒸馏基线的隐私-效用权衡,在三个独立的LLM评判者上表现一致。与由Gemini~2.5~Flash和Claude等前沿模型驱动的对抗性匿名化相比,它实现了相当或更好的整体权衡,同时去除了明显更多的私人信息,并且完全在设备端运行,成本约为GPT-4o教师模型的$1\%$。
查看缓存全文
缓存时间: 2026/08/10 08:01
# GRASP:使用群体相对策略优化强化语言模型匿名化器
来源:https://arxiv.org/html/2608.06526
Sajjad Ghiasvand, Mark Beliaev, Mahnoosh Alizadeh, & Ramtin Pedarsani
加州大学圣巴巴拉分校电气与计算机工程系
Santa Barbara, CA 93106, USA
\{sajjad,mbeliaev,alizadeh,ramtin\}@ucsb\.edu
Sajjad Ghiasvand¹ Nader Sehatbakhsh²
¹ 加州大学圣巴巴拉分校电气与计算机工程系
² 加州大学洛杉矶分校电气与计算机工程系
sajjad@ucsb\.edu
nsehat@ee\.ucla\.edu
###### 摘要
大型语言模型能够从普通文本中推断出年龄、位置和职业等敏感个人属性,将日常书写变成隐私风险。对抗式匿名化通过使用同时扮演攻击者的强大语言模型重写文本来防御这一威胁,但这种方法在推理时需要强大的模型,因而必须将私人文本发送给第三方——而这恰恰是匿名化本应防止的暴露风险。近期研究通过监督微调和直接偏好优化(DPO)将此行为蒸馏到小型设备端模型中,但DPO仅模仿教师的离线选择,从未直接优化我们所关心的隐私–效用目标。我们提出**GRASP**(Group-Relative Anonymization via Self-refinement Policy-optimization,基于自精炼策略优化的群体相对匿名化),该方法通过群体相对策略优化(GRPO)在线强化本地匿名化器。单个小型模型同时充当匿名化器、对手和效用评判者,针对一个自生成的奖励进行训练,该奖励在隐藏属性的同时保留语义,并设计了防止奖励欺骗的机制。GRASP在Llama-3.1-8B上训练,在隐私–效用权衡上优于DPO蒸馏基线,且在三个独立的LLM评判者下结果一致。与由Gemini 2.5 Flash和Claude等前沿模型驱动的对抗式匿名化相比,GRASP在实现相当或更好的整体权衡的同时,消除了显著更多的私人信息,并且完全在设备端运行,成本约为GPT-4o教师的1%,远低于前沿匿名化器的成本。
GRASP:使用群体相对策略优化强化语言模型匿名化器
Sajjad Ghiasvand¹ Nader Sehatbakhsh²
¹ 加州大学圣巴巴拉分校电气与计算机工程系
² 加州大学洛杉矶分校电气与计算机工程系
sajjad@ucsb\.edu
nsehat@ee\.ucla\.edu
## 1 引言
参见图注
图1:GRASP概览。*阶段1:*我们复用SEAL的GPT-4o对抗式匿名化轨迹,通过监督微调将一个小型语言模型训练为冻结的参考模型π_ref,使其能够匿名化、推断属性并评估效用。*阶段2:*我们使用GRPO优化匿名化策略π_θ。对于每段文本,π_θ采样一组候选重写;冻结的π_ref作为对手和评判者为每个候选打分,得到隐私–效用奖励,群体相对优势通过以π_ref为KL锚点更新策略。*阶段3:*推理时,训练好的策略完全在设备端运行,通过交替进行匿名化和批判自身输出来实现自精炼,无需任何外部模型。
大型语言模型能够以惊人的准确率从普通文本中推断出年龄、位置、职业和收入等敏感个人属性(Staab et al., 2024, 2025),将日常在线写作变成隐私负担,并加剧了已知的暴露风险,如训练数据的记忆和提取(Carlini et al., 2021, 2022)。随着人们越来越多地通过LLM写作和分享文本(Achiam et al., 2023; Grattafiori et al., 2024; Team et al., 2025),日益需要重写文本,使其在保留语义的同时,私人属性不再能被推断出来(Dou et al., 2024)。经典的匿名化方法通过命名实体识别或基于规则的文本脱敏来移除显式标识符(Microsoft, 2025; Pilán et al., 2022),改写模型则改变表面形式(Krishna et al., 2023),但两者都无法应对现代推断攻击所利用的上下文线索(Gadotti et al., 2024)。迄今为止最强的防御手段是对抗式匿名化(Staab et al., 2025; Yang et al., 2025; Frikha et al., 2025),它使用一个同时扮演攻击者的强大LLM迭代地重写文本。这种方法有效,但推理时需要强大的模型,因此用户要么付费使用前沿API,要么将私人文本发送给第三方(Hou et al., 2025),而这恰恰是匿名化旨在防止的暴露。为了保持匿名化的本地性,SEAL(Kim et al., 2026)将对抗式匿名化蒸馏(Hinton et al., 2015; Levine et al., 2025)到一个小型语言模型中,使其能够匿名化、推断并评估自身的重写,使用监督微调后接直接偏好优化(DPO)(Rafailov et al., 2023)。然而,DPO只是模仿从教师轨迹中离线挖掘的偏好:它学习复现教师偏好的重写,但从未直接优化我们所关心的隐私–效用目标,也无法超越它所蒸馏的示范。我们的关键观察是,匿名化具有明确且可测量的目标,即对手是否仍能推断出目标属性以及文本的效用是否得到保留,而单个蒸馏模型可以同时充当匿名化器、对手和效用评判者。这使得直接使用在线强化学习优化该目标成为自然之选,而非离线模仿教师。人类反馈强化学习需要针对昂贵的人类偏好标签训练语言模型(Christiano et al., 2017; Ziegler et al., 2019; Stiennon et al., 2020; Ouyang et al., 2022),而我们的奖励由模型自身生成,因为它迭代地精炼自己的重写(Madaan et al., 2023)并作为攻击者和LLM评判者为其打分(Zheng et al., 2023)。
我们提出**GRASP**(Group-Relative Anonymization via Self-refinement Policy-optimization),它使用群体相对策略优化(GRPO)(Shao et al., 2024; Guo et al., 2025)针对一个结合了冻结参考模型的残余属性推断与效用评估的奖励来微调匿名化策略。与PPO(Schulman et al., 2017)不同,GRPO从一组采样的重写中估计优势,无需单独学习价值网络,这适合变长文本生成,并自然地映射到对同一输入的多个候选匿名化进行比较。由于策略是针对自身样本打分的,它能够探索教师从未产生的重写,将隐私–效用前沿推向蒸馏天花板之上。同一个冻结模型既提供奖励又锚定更新,因此在训练和推理时都不需要外部模型。图1展示了完整流程。
GRASP在Llama-3.1-8B(Grattafiori et al., 2024)上训练,在隐私–效用权衡上超越了最先进的DPO蒸馏基线,且在三个独立的LLM评判者下结果一致。与由Gemini 2.5 Flash(Google DeepMind, 2025)和Claude(Anthropic, 2025)等前沿模型驱动的对抗式匿名化相比,GRASP在实现相当或更好的整体权衡的同时,消除了显著更多的私人信息,并且完全在设备端运行,成本约为其蒸馏来源GPT-4o(Achiam et al., 2023)教师的1%,远低于前沿匿名化器的成本。
总之,我们的贡献如下:(1) 我们将本地文本匿名化建模为针对自生成对抗奖励的直接强化学习,而非对教师的离线模仿;(2) 我们实现了GRASP,一种GRPO方案,其中单个小型模型同时充当匿名化器、攻击者和效用评判者;(3) 通过大量实验和消融研究,我们证明GRASP在隐私–效用权衡上优于蒸馏方法,在隐私方面优于前沿模型基线,同时保持廉价且完全本地化。
## 2 预备知识
我们研究针对*推理时*隐私威胁的匿名化,其中强大的语言模型充当对手,从看似无害的文本中推断私人属性(Staab et al., 2024)。本节形式化威胁模型,并回顾对抗式匿名化流程以及我们方法所基于的轨迹数据。
#### 威胁模型与问题陈述。
设x为用户撰写的文本,可能泄露作者关于私人属性集P(例如年龄、性别、位置、职业)的信息。对手是一个语言模型M_priv,给定x和目标属性集P,以置信度分数预测每个属性的值。与通过命名实体识别或模式匹配移除的经典标识符不同,这些属性通常编码在依赖于上下文的语义线索中,这些线索在表面级清洗后仍然存在(Staab et al., 2024)。匿名化器将x重写为x′,使得P中的属性不再能被可靠地从x′推断出来,同时保留原始语义内容和可读性。因此,目标是获得良好的*隐私–效用权衡*:在最小化文本语义和流畅性损失的前提下,提供针对属性推断的强保护。
#### 对抗式匿名化。
获得此类重写的一种强大方法是反馈引导的对抗式匿名化(Staab et al., 2025),其中匿名化器M_anon和对手M_priv交替工作:对手推断仍然暴露的属性,匿名化器编辑文本以移除它们。给定初始文本x₀和目标属性P,并额外引入效用评估器M_util,该过程对t=0,1,...,T−1重复以下三个步骤:
(1) 推断 P_t ∼ M_priv(x_t, P),
(2) 精炼 x_{t+1} ∼ M_anon(x_t, P_t),以及
(3) 效用 U_{t+1} ∼ M_util(x₀, x_{t+1}),
其中每个推断出的属性p ∈ P_t带有理由和置信度分数conf(p),U_{t+1}收集x_{t+1}相对于x₀的效用度量(例如可读性和语义保留程度)。该过程在固定步数后或无法再推断出更多属性时终止,产生轨迹τ = (s₀, s₁, ..., s_T),其中每个状态s_i = (x_i, P_i, U_i)将文本与其推断属性和效用度量配对。使用许多LLM作为M_anon、M_priv和M_util在语料库上运行,产生轨迹集T,捕捉文本如何被逐步匿名化的过程(Staab et al., 2025)。
#### 匿名化评分。
为了比较轨迹内的状态,我们使用标量隐私和效用分数。遵循Staab等人(2025),当推断出的属性更少且推断出的属性置信度更低时,匿名化更私密;当效用度量的平均值更高时,匿名化更有用:
p(s_i) = (−|P_i|, −(1/|P_i|)∑_{m∈P_i} conf(m)), (1)
u(s_i) = (1/|U_i|)∑_{m∈U_i} m。 (2)
隐私分数按字典序排序(先按推断属性数量,再按平均置信度),因此p(s_j) > p(s_i)意味着s_j严格比s_i更私密;效用分数按平均值比较。这些排序在每个轨迹内识别出哪些较晚的重写在隐私和效用上支配较早的重写,并构成将匿名化行为蒸馏到小型语言模型中的监督信号。
#### 蒸馏设置。
我们的目标是将这种行为蒸馏到单个小型语言模型(SLM)中,使其能够执行匿名化及其自身评估,从而使匿名化可以在本地运行,无需查询外部且可能不可信的模型(Staab et al., 2025)。具体而言,给定上述收集的轨迹集T,我们训练目标策略π_θ,使其能够 (a) 重写文本以改善其隐私–效用权衡,(b) 作为对手从文本中推断私人属性,以及 (c) 评估重写的效用。第3节描述我们如何使模型适应这些任务,然后使用强化学习优化其匿名化策略。
#### 通过监督微调进行任务适配。
我们将基础模型适配到用于自精炼的三种能力:(i) *匿名化*——重写文本以降低属性可推断性;(ii) *对抗式推断*——以置信度预测私人属性;以及 (iii) *效用评估*——判断重写的语义保留程度和可读性。使用上述定义的隐私和效用排序,我们从每个轨迹τ ∈ T中挖掘较晚重写支配较早重写的配对,以及每个状态的推断和效用标签:
D_anon = {(x_i, x_j) | 0 ≤ i < j ≤ T, p(s_j) > p(s_i), u(s_j) ≥ u(s_i)},
D_priv = {(x_i, P_i) | s_i ∈ τ},相似文章
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
@probablynotaz9: ICML 单作者论文警报:是否曾想用经典策略梯度对扩散 LLM 进行后训练,而无需……
这篇 ICML 单作者论文介绍了摊销式组相对策略优化(AGRPO),旨在为扩散语言模型实现高效的强化学习后训练。
当合成语音是唯一资源时:GRPO更胜一筹
本文提出使用Group Relative Policy Optimization(GRPO)来适配基于LLM的ASR模型到监管领域,仅使用合成语音,相较于监督微调实现了40-45%的相对词错误率降低。
超越 GRPO 与策略内蒸馏:语言模型后训练的经验性“稀疏至稠密”奖励原则
本文提出了一种用于语言模型后训练的经验性“稀疏至稠密”奖励原则,主张应使用稀疏奖励配合稀缺的标注数据进行教师模型发现,并使用稠密奖励通过蒸馏进行学生模型压缩。作者证明,这种连接稀疏强化学习与策略内蒸馏的分阶段方法,在数学基准测试中优于在部署规模模型上直接运行 GRPO 的效果。
驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO
本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。